4.0
深览指数
产品量子位··AI 生成

蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash

蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash,总参数量124B,激活仅5.1B,在推理、指令遵循等指标上对标2-3倍参数量的行业领先模型。该模型针对Agent场景深度优化,扩展了超10000个真实交互训练环境,并采用混合注意力架构(KDA+MLA,5:1比例)实现高智效比。模型已上线OpenRouter,限时免费一周后将正式开源。本文为产品发布通稿,主要提供技术指标与架构简述,适合对模型技术路线和落地性价比感兴趣的读者快速了解。原文 ↗

核心观点
  • 蚂蚁百灵Ling-3.0-Flash以124B参数、5.1B激活的小体量,在核心指标上对标2-3倍参数量的行业领先模型,主打高智效比与落地性价比。
  1. 01模型总参数量124B,单次计算激活5.1B,专家激活比例由前代1/32压缩至1/64。
  2. 02模型扩展了超10000个真实交互训练环境,优化了自我纠错与长程规划机制。
  3. 03采用混合注意力架构,以5:1比例交替堆叠KDA线性注意力层与MLA层。
  4. 04将Lightning Attention升级为KDA,引入细粒度对角门控以提升长文档处理中的关键信息记忆能力。
  5. 05通过集群级分级缓存,将长输入下的首字响应延迟降低了60%至80%以上。
  6. 06升级了多智能体协同架构,支持不同Agent分工协作与相互校验以减少误判风险。
  7. 07模型已上线OpenRouter,限时免费一周,之后将正式开源。
反方 / 局限
  • 文章为蚂蚁百灵发布通稿,未提及模型在特定任务上的失败案例、与其他模型的横向对比劣势、或在小样本/少样本场景下的表现局限性。
3 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

延伸追问