产品量子位··AI 生成
蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash
蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash,总参数量124B,激活仅5.1B,在推理、指令遵循等指标上对标2-3倍参数量的行业领先模型。该模型针对Agent场景深度优化,扩展了超10000个真实交互训练环境,并采用混合注意力架构(KDA+MLA,5:1比例)实现高智效比。模型已上线OpenRouter,限时免费一周后将正式开源。本文为产品发布通稿,主要提供技术指标与架构简述,适合对模型技术路线和落地性价比感兴趣的读者快速了解。原文 ↗原文 ↗
核心观点
- ▍蚂蚁百灵Ling-3.0-Flash以124B参数、5.1B激活的小体量,在核心指标上对标2-3倍参数量的行业领先模型,主打高智效比与落地性价比。
- 01模型总参数量124B,单次计算激活5.1B,专家激活比例由前代1/32压缩至1/64。
- 02模型扩展了超10000个真实交互训练环境,优化了自我纠错与长程规划机制。
- 03采用混合注意力架构,以5:1比例交替堆叠KDA线性注意力层与MLA层。
- 04将Lightning Attention升级为KDA,引入细粒度对角门控以提升长文档处理中的关键信息记忆能力。
- 05通过集群级分级缓存,将长输入下的首字响应延迟降低了60%至80%以上。
- 06升级了多智能体协同架构,支持不同Agent分工协作与相互校验以减少误判风险。
- 07模型已上线OpenRouter,限时免费一周,之后将正式开源。
反方 / 局限
- — 文章为蚂蚁百灵发布通稿,未提及模型在特定任务上的失败案例、与其他模型的横向对比劣势、或在小样本/少样本场景下的表现局限性。
前置背景
平行视角
延伸追问