6.7
深览指数
科技量子位··AI 生成

全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归

蚂蚁集团旗下inclusionAI团队发布LLaDA2.2,这是全球首个千亿参数MoE扩散语言模型,专门为智能体(Agent)长程任务设计。它通过Levenshtein编辑范式、强化学习(L-EBPO)和128K上下文窗口,实现了边行动边纠错的能力,在七大Agent基准测试中平均得分53.83,与顶尖自回归模型Ling-2.6-flash的55.74分差距不到2分,且推理吞吐量是其1.64倍。文章认为,这打破了自回归模型在Agent领域的垄断,预示着未来Agent架构可能需要自回归与扩散双轨并行。适合对AI Agent架构、模型路线选择有技术背景的读者阅读。原文 ↗

核心观点
  • 自回归模型并非Agent大模型的唯一选择,扩散模型通过技术整合也能在Agent长程任务中达到相近水平,未来Agent架构可能需要自回归与扩散双轨并行。
  1. 01LLaDA2.2是千亿参数MoE扩散语言模型,原生支持128K上下文,是全球首个大规模Agentic扩散模型。
  2. 02模型采用Levenshtein编辑范式,支持KEEP、SUBSTITUTE、DELETE、INSERT四种原子操作,能在生成过程中自我修正,仅此一项使SWE-bench Verified得分从35.8提升至44.4。
  3. 03通过L-EBPO(Levenshtein Editing Evidence Lower Bound Policy Optimization)将编辑决策建模为强化学习问题,使模型能根据环境反馈动态修正。
  4. 04在七大Agent基准测试中,LLaDA2.2-flash平均得分53.83,与顶尖自回归模型Ling-2.6-flash的55.74分差距小于2分,且在τ²-Bench、PinchBench、MCP-Atlas三项交互式任务上实现反超。
  5. 05LLaDA2.2-flash的BF16平均吞吐量是Ling-2.6-flash的1.64倍,量化至FP8后可额外提升18.6%。
  6. 06通过BlockRouting机制,在block层面筛选top-C专家形成固定池,降低了HBM流量和通信开销,使128K上下文工程部署成为可能。
  7. 07LLaDA系列从2.0到2.2,半年内完成了从规模化验证、边写边改到智能体觉醒的递进研发。
反方 / 局限
  • 文章承认LLaDA2.2并未完全跑赢自回归模型,在严格结构化输出和复杂代码生成中,自回归模型依然更成熟。
  • 作者观点中隐含的张力:文章主要依赖蚂蚁集团自身发布的基准测试结果,缺乏第三方独立验证,且对比模型Ling-2.6-flash的背景和公开信息未充分交代。
11 分钟 · 5 卡片 · 11 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问