7.0
深览指数
产品人人都是产品经理·卡尔的AI沃茨··AI 生成
实测小米新模型MiMo V2.6,我真服了第一次看开源那么彻底的
文章作者作为小米模型的老用户,详细评测了新发布的MiMo V2.6系列模型(Pro、Flash、UltraSpeed)。文中的核心发现是:该模型在多项基准测试(如DeepSWE、CritPT)上取得了接近第一梯队(GPT、Claude)的成绩,但API价格仅为同级海外模型的二十分之一到六十分之一。作者的独特贡献在于,他并非仅罗列参数,而是通过复刻网站、生成SVG动画、制作PPT、搭建3D模型和游戏、以及改造自身项目等真实任务,逐一验证了模型在视频理解、多模态融合、代码生成和复杂指令跟随上的实际能力。结论是模型从“够用”进入“主力”候选。适合正在评估开源或低成本替代方案的AI应用开发者、架构师及中小团队决策者阅读,尤其是对价格敏感、需要模型处理非纯文本任务的场景。原文 ↗
核心观点
- ▍小米MiMo V2.6系列模型在性能上(如AA综合评分46.32分)已接近Grok、GPT-4o等第一梯队,但其API价格仅为海外同级的1/20至1/60,使其成为高性价比的“赛博大善人”级别选择。
- 01在Artificial Analysis上,MiMo V2.6 Pro以46.32分排名开源第一、国产第一,与Grok 4.7持平,性能较V2.5的26分大幅跃升近一倍,且基座未换,提升全部来自后训练。
- 02具体评测中,模型在CritPT(物理推理)榜单上仅次于GPT和Claude;在DeepSWE v1.1(长程软件工程任务)上,Pro从58.4涨至72.57,Flash从48.8涨至65.68。
- 03实测中,模型能通过输入录屏视频,一句指令复刻出带有滚动动效和玻璃雾面字体的网页,证明了其视频理解和前端复刻能力。
- 04在生成“鹈鹕骑自行车”SVG动画时,模型不仅让轮子和踏板按比例联动,还自动添加了可调节速度(0.4x-2.2x)的倍速条和围巾装饰,展现出独特的审美。
- 05面对Artemis II绕月PPT任务,模型能结合PDF、音频(WAV)、图片等混合材料,自动排出按飞行时间线展开的7页PPT,并借鉴小米发布会配色。
- 06在制作3D折叠纸盒动画时,模型自动安装了缺失的Blender,并成功制作出参数可调、结构完整的折叠动画。
- 07在作者自身项目(goodcase网站)中,模型设计了Jev + MiMo双模型协作方案,创建多点快照表,并确保了算法兼容性,使得新方案不破坏既有数据排序。
反方 / 局限
- — 文章提到AA评分仅反映平均表现,但未讨论特定任务下的极端情况或模型在长尾问题上的鲁棒性。全篇实测均为单次或少量示例,缺乏大规模、压力测试下的稳定性数据。
MiMo V2.6卡尔小米Grok 4.7Artificial AnalysisTerminal-Bench 4.0CritPTDeepSWE v1.1GLM-5.3Qwen 3.8 MaxJevDeepSeekGuess你CodexArtemis IIBlendergoodcase
19 分钟 · 4 卡片 · 9 资料
读原文 →