7.2
深览指数
科技腾讯新闻·爱范儿··AI 生成
刚刚,小米刷新AI大模型斩杀线,罗福莉:技术难度超过DeepSeek R1
小米正式发布并开源 MiMo-V2.6 系列全模态模型,以 46.32 分登顶开源模型综合性能榜首,并大幅压低 API 价格至海外模型的 1/20-1/60。同时公开了耗资约 347 万美元的强化学习训练细节,团队负责人罗福莉称其技术难度超过 DeepSeek R1。文章提供了详细基准测试对比、训练数据和方法论,适合关注国产大模型前沿、模型评测和开源生态的读者。原文 ↗
核心观点
- ▍MiMo-V2.6 在综合性能上成为新的开源模型标杆,其 API 价格仅为海外同级模型的 1/20-1/60,组合构成了 AI 模型市场新的「斩杀线」:能力低于它的产品被淘汰,价格高于它的必须证明溢价合理性。
- ▍罗福莉认为 MiMo-V2.6 背后的研究创新和工程难度超过其曾参与过的 DeepSeek R1,体现在 MixRL 与 MOPD 的分工设计,以及数十人团队在算力稀缺情况下的长期协同。
- 01MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3 得 46.32 分,超过 Kimi K3 和 Qwen3.8 Max,被小米称为该榜单得分最高的开源模型。
- 02训练过程公开:MiMo-V2.6-Flash 和 Pro 各完成 30 个 RL step,分别花费约 85 万和 262 万美元,共约 347 万美元,产生约 75 万条训练轨迹。
- 03在 Long context 软件工程评测 DeepSWE v1.1 上,Flash 从 48.8 分提升至 65.68 分,Pro 从 58.4 分提升至 72.57 分,多项目在训练后半程仍保持增长,表明模型学到了通用长程执行能力。
- 04MiMo-V2.6 展示了覆盖游戏设计与 3D 建模、具身机械臂操控、音乐创作、材料科学辅助研究及 Lean 4 数学定理形式化等多种「Vibe World」任务案例。
- 05价格策略激进: MiMo-V2.6-Flash 每百万 token 输出价 2 元,Pro 为 6 元,对标海外模型价格仅为 1/20 至 1/60。
- 06小米同步发布了蒸馏版 MiMo-V2.6-Distill-Qwen-9B 及约 7000 个 RL 任务环境、验证器、训练框架等全套工具,贡献给开源社区。
- 07Pro-UltraSpeed 版本在保持质量前提下,输出速度可达 Pro 版 20 倍,但调用成本也相应提升至 10 倍。
反方 / 局限
- — MiMo-V2.6 尚未在所有能力上追平闭源前沿模型,例如 Pro 在 Terminal Bench 4.0 得 34.9 分,远低于 GPT 6 Astra 的 59.6 和 Claude Fable 5.1 的 55.1,在多项网络安全评测中也整体落后于头部闭源模型。
- — 大规模 RL 存在训练漂移和奖励投机的风险,模型可能寻找评分规则漏洞表面拿高分而实际未完成任务,小米需通过固定 MoE 路由器、多验证器交叉核验等手段保证稳定性。
- — 文章展示的 Vibe World 科研案例(如材料科学辅助、数学定理形式化)强调模型未受过专门科研 RL 训练,且多数案例仍停留在演示阶段,日常工作中调用的便利性与长时使用成本仍需验证。
MiMo-V2.6罗福莉DeepSeek R1Kimi K3Qwen3.8 MaxArtificial Analysis Intelligence IndexDeepSWEMixRLMOPDOpenRouterHugging FaceMoE
11 分钟 · 4 卡片 · 11 资料
读原文 →