7.1
深览指数
科技腾讯新闻·定焦One··AI 生成
一个月9款旗舰,大模型进入“月抛”时代?
7月,9款旗舰大模型密集发布,作者认为“最强模型”的保质期正在缩短,竞争已从单一的通用能力比拼,转向代码、智能体、参数效率和价格等多维度。文章分析了Kimi K3、Grok 4.5、GPT-5.6 Sol等新模型的实际表现和开发者反馈,并指出模型迭代加速、开源模型进入第一梯队是行业两大关键变化。适合关注AI产业动态、想了解模型能力真实差距与技术路线的技术决策者和投资人阅读。原文 ↗
核心观点
- ▍大模型竞争已从单一通用能力比拼,扩展到代码、智能体、参数效率和价格等多个维度,任何单一维度的领先优势都难以维持。
- ▍开源模型正在进入第一梯队,在部分开发场景中已能与闭源模型直接竞争,打破了以往“开源追赶闭源”的格局。
- 017月发布的9款旗舰模型中,Kimi K3以1679分登上Code Arena前端编程榜第一,超过GPT-5.6 Sol和Claude Fable 5。
- 02腾讯混元Hy3总参数295B、激活参数仅21B,以不到旗舰模型五分之一的参数规模,在多个公开基准中的成绩接近体量更大的竞品模型。
- 03Grok 4.5输出价格仅为Opus系列的四分之一,并通过与Cursor的绑定吸引开发者,被开发者视为高性价比选择。
- 04开发者的实际使用呈现分化:GPT-5.6负责日常开发,Grok 4.5用于快速开发,Kimi K3用于前端场景,Claude Opus 5负责解决复杂问题。
- 05模型迭代加速的原因之一是后训练技术成熟,模型升级更多依赖强化学习等训练后优化,而非重新训练更大规模模型。
反方 / 局限
- — Kimi K3在知识可靠性测试中,幻觉率从Kimi K2.6的39%升至51%,输出速度约33 Token/s,远低于同类模型,能力存在明显偏科。
- — 智能体在实际工作中仍不成熟,存在任务调度能力不足、Token消耗高但有效工作增加有限等问题。
- — Qwen3.8-Max预览版效果不稳定,有开发者反馈其实际能力与宣传存在明显差距,最终表现仍需等待正式版验证。
Kimi K3Grok 4.5GPT-5.6 SolClaude Opus 5腾讯混元Hy3Qwen3.8-MaxGemini 3.6 FlashOpenAIAnthropicxAICursorDeepSeekMoE架构后训练World Artificial Intelligence Conference (WAIC)
12 分钟 · 5 卡片 · 15 资料
读原文 →