科技智东西··AI 生成
对话蚂蚁百灵负责人:AGI不止Coding一条路,好模型要走向真实世界
本文是智东西对蚂蚁集团百灵大模型团队负责人的专访。核心观点包括:蚂蚁认为好模型应走向真实世界解决高价值任务,而不是只卷Coding;蚂蚁提出了“智效比”(计算、参数、Token效率)理念,并通过MoE稀疏化、混合线性、小模型压缩等手段落地;百灵已开源Ling-3.0-flash-VL和金融增强模型,其支撑的阿福健康AI用户破1.5亿,日咨询2000万。文章详细解释了金融、医疗等严肃场景如何反哺基座模型,以及模型在推理成本、隐私、任务成功率和拒答能力上的挑战与应对。适合关注国产大模型差异化路线、AI产业落地与端侧智能的读者阅读。原文 ↗原文 ↗
核心观点
- ▍好模型不应只追求Coding能力,而应走向真实世界,解决高经济价值、高难度的任务,这是AGI的更广泛路径。
- ▍蚂蚁提出“智效比”理念,关注计算效率、参数效率与Token效率,通过MoE稀疏化、混合线性机制、大模型压缩等路线,在可控成本下追求更高智能。
- 01蚂蚁百灵已开源Ling-3.0-flash-VL(原生多模态)和Ling-3.0-flash-Fin(金融增强模型),后者在金融投研测评中超越前沿通用模型。
- 02蚂蚁旗下健康AI“阿福”用户已突破1.5亿,日咨询量2000万,被称全球第一大健康AI App;AI版支付宝“阿宝”、AI原生助手“灵光”等也在增长。
- 03蚂蚁采用“智效比”路线,将大尺寸模型智能压缩到小尺寸,结合MoE Scaling law发现稀疏化在未到临界点时智能反而提升。
- 04金融投研领域,蚂蚁从可校验的分析与估值建模入手,利用一二级市场专家参与预训练环节构建专业数据,而非仅靠Post-train。
- 05在医疗场景,阿福面对用户(尤其三四线用户)的难题,一方面帮患者连接医生/机构,另一方面帮医生用AI提高接诊效率。
- 06模型训练中面临“准确率与拒答”的权衡,蚂蚁在金融、医疗严肃场景中对幻觉的拒绝设置更重的Reward惩罚,宁愿说不知道也不给多口径答案。
- 07零幺指出,目前唯一未观察到边际收益递减的Scaling维度是Pre-train Scaling(FLOPs scaling),其他如推理Token通常收敛。
反方 / 局限
- — 西亭承认,真实世界任务的数据不如Coding丰富,数据匮乏是模型走向真实场景的主要制约。
- — 模型在C端应用中,推理成本随用户增长急剧上升,部分场景需用小模型替代大模型;且海外用户因隐私顾虑不愿将数据接入云端,同态加密等方案仍待成熟。
- — 零幺指出,当前Benchmark大多鼓励输出而非拒答,导致模型为得分而迎合;单纯追求准确率与抑制幻觉之间存在明显trade-off,评估标准尚需改进。
17 分钟 · 4 卡片 · 11 资料
读原文 →前置背景
平行视角
未来推演
延伸追问