7.0
深览指数
科技虎嗅·AIX财经··AI 生成
千问迎战Kimi、DeepSeek,阿里的胜算在哪?
阿里发布参数规模达2.4万亿的Qwen3.8-Max模型,在科研编程和Agent任务上进步明显,基准测试部分超越海外旗舰,但在真实软件工程和复杂环境操作中仍有差距。与国内竞品Kimi K3和DeepSeek V4 Flash对比,Qwen3.8-Max多数项目落后于Kimi K3但差距有限,能力高于DeepSeek V4 Flash但价格差距远大于能力差距。文章指出,阿里真正的壁垒不是单一模型,而是覆盖云计算、企业应用和开源生态的完整体系,但模型能力仍是决定能否长期留在第一梯队的核心变量。适合关注国产大模型竞争格局和阿里AI战略的深度读者。原文 ↗
核心观点
- ▍阿里的竞争力已不再是单一Qwen模型,真正的壁垒在于模型能力、价格和云服务及企业生态三者构成的综合体系,但模型能力仍是是否长期留在第一梯队的核心变量。
- ▍Qwen3.8-Max已进入头部模型竞争范围,但实际交付质量与开发者口碑存在落差,更接近第一梯队候选而非稳固的领先者。
- 01Qwen3.8-Max参数规模2.4万亿,支持100万Token上下文,API定价为每百万Token输入12元、输出36元,在国产头部模型中处于中间价位。
- 02官方基准测试中,Qwen3.8-Max在PaperBench得93分(前代64.8分),Agents' Last Exam通过率从11.8%升至27%,但在SWE-bench Pro测试中为67.7分,比Anthropic Fable 5低12.3分。
- 03与国内竞品Kimi K3对比,Qwen3.8-Max只在工作流智能体任务上超过对方,其余项目多数落后;与DeepSeek V4 Flash对比,Qwen3.8-Max在所有可比项目中占优,但价格差距远大于能力差距。
- 04阿里已覆盖通用语言、编程、数学、视觉、语音、全模态和视频生成,并延伸到世界模型和具身智能,同时拥有云计算、钉钉、淘宝等企业级应用场景。
- 05开发者测试反馈显示,Qwen3.8-Max在任务拆解、Agent调用和UI设计上有明显提升,但存在“有点懒”、需要把要求拆得非常具体才能执行到位的问题,且HTML标签直接显示在页面上。
- 06长周期任务方面,Qwen3.8-Max连续运行约16天从零构建开源项目,但验证能力需看能否在不同任务中以较少人工介入稳定交付。
反方 / 局限
- — 技术路线逐渐趋同,MoE架构、百万Token上下文、Agent编程、多模态和开放权重几乎成为国产头部模型共同发展方向,不再是千问独有的优势。
- — 企业越来越倾向于在同一套系统中调用多个模型,平台越开放,模型被替换也越容易,如果千问长期落后于第一梯队,云和渠道只能延缓用户流失。
Qwen3.8-MaxKimi K3DeepSeek V4GLM 5.2Anthropic Fable 5OpenAI GPT-5.6 SolClaude Opus 4.8阿里月之暗面深度求索智谱千问SWE-bench ProPaperBenchArena榜单MoEAgent
13 分钟 · 5 卡片 · 13 资料
读原文 →