7.1
深览指数
科技腾讯新闻·定焦One··AI 生成

一个月9款旗舰,大模型进入“月抛”时代?

7月,9款旗舰大模型密集发布,作者认为“最强模型”的保质期正在缩短,竞争已从单一的通用能力比拼,转向代码、智能体、参数效率和价格等多维度。文章分析了Kimi K3、Grok 4.5、GPT-5.6 Sol等新模型的实际表现和开发者反馈,并指出模型迭代加速、开源模型进入第一梯队是行业两大关键变化。适合关注AI产业动态、想了解模型能力真实差距与技术路线的技术决策者和投资人阅读。原文 ↗

核心观点
  • 大模型竞争已从单一通用能力比拼,扩展到代码、智能体、参数效率和价格等多个维度,任何单一维度的领先优势都难以维持。
  • 开源模型正在进入第一梯队,在部分开发场景中已能与闭源模型直接竞争,打破了以往“开源追赶闭源”的格局。
  1. 017月发布的9款旗舰模型中,Kimi K3以1679分登上Code Arena前端编程榜第一,超过GPT-5.6 Sol和Claude Fable 5。
  2. 02腾讯混元Hy3总参数295B、激活参数仅21B,以不到旗舰模型五分之一的参数规模,在多个公开基准中的成绩接近体量更大的竞品模型。
  3. 03Grok 4.5输出价格仅为Opus系列的四分之一,并通过与Cursor的绑定吸引开发者,被开发者视为高性价比选择。
  4. 04开发者的实际使用呈现分化:GPT-5.6负责日常开发,Grok 4.5用于快速开发,Kimi K3用于前端场景,Claude Opus 5负责解决复杂问题。
  5. 05模型迭代加速的原因之一是后训练技术成熟,模型升级更多依赖强化学习等训练后优化,而非重新训练更大规模模型。
反方 / 局限
  • Kimi K3在知识可靠性测试中,幻觉率从Kimi K2.6的39%升至51%,输出速度约33 Token/s,远低于同类模型,能力存在明显偏科。
  • 智能体在实际工作中仍不成熟,存在任务调度能力不足、Token消耗高但有效工作增加有限等问题。
  • Qwen3.8-Max预览版效果不稳定,有开发者反馈其实际能力与宣传存在明显差距,最终表现仍需等待正式版验证。
12 分钟 · 5 卡片 · 15 资料
读原文 →

前置背景

功能拆解

平行视角

未来推演

延伸追问