7.0
深览指数
科技腾讯新闻··AI 生成
阶跃发布Step 5 Preview:600B MoE瞄准长程Agent,10月将开源
阶跃星辰于9月20日发布新一代旗舰基座模型Step 5 Preview,采用600B参数、稀疏MoE架构,重点面向长程Agent场景(AI编程、金融分析等)。文章详细拆解了模型在架构设计上的关键决策:92层'窄而深'设计以优化长Prefill推理、Sparse GQA与Token合并降低百万上下文开销、模型参与自身训练数据生产以实现'自进化',以及在长程强化学习中实现训练与推理bit-wise对齐的方案。适合关注模型架构前沿、国产大模型技术细节的AI从业者或研究者阅读。原文 ↗
核心观点
- ▍阶跃星辰认为,大模型下一阶段Scaling的关键不再是单纯增加计算量换取智能,而是提升计算转化为智能的效率(从Step 3.5 Flash到Step 5 Preview均延续此探索)。
- 01Step 5 Preview采用92层'窄而深'的MoE架构(总参数量600B,每个Token约激活27B),旨在为长Prefill阶段的隐式多跳推理提供更长信息传播路径。
- 02为降低百万Token上下文开销,模型引入Sparse GQA,通过稀疏索引选择相关历史信息;并采用Block-wise Token Merging将Indexer和Top-k Selection成本降至原来的1/8。
- 03模型被用于构建自身后续迭代的训练数据,通过建立统一上下文层、结构化知识空间和Anti-hacking审计来避免Agent任务趋同或寻找评测漏洞。
- 04在长程强化学习中,Step 5 Preview实现了训练与推理的bit-wise对齐(端到端开销<10%,logprob偏差<1e-2),并采用负载感知调度、MTP-3投机解码、FP8 MoE等技术使训练加速超过三倍。
- 05根据Artificial Analysis综合指数44分,阶跃星辰声称该模型进入全球开源模型前三,平均单任务成本约0.71美元,官方称单任务成本为Claude Opus 5的1/8。
- 06模型支持100万Token上下文及文本、图像输入,计划于10月15日开放权重。
反方 / 局限
- — 文章承认,直接让Agent生成数据任务容易导致任务趋同,且能力更强的模型可能寻找评测漏洞而非解决真实问题。
- — 算法层面的稀疏(Sparse GQA)并不必然带来同等幅度的速度提升,Indexer开销、分散的数据读取和较低的GPU利用率都可能抵消理论收益。
- — 官方声称的'单任务成本为Claude Opus 5的1/8'应限定在其选取的任务和配置中。Step 5 Preview在综合评测中生成了1.60亿输出Token,高于同价位模型中位数(9200万),较低单价可能被更长的推理过程部分抵消。
6 分钟 · 5 卡片 · 13 资料
读原文 →