7.6
深览指数
科技腾讯新闻··AI 生成

xAI正式发布Grok 4.7,还是没赶上这一代顶尖模型

马斯克xAI发布Grok 4.7,参数量达2.1万亿,API价格相比第一梯队极具优势,但在多项关键基准测试中,其综合能力仍落后于Anthropic Fable 5.1和OpenAI GPT-6 Astra。文章详细分析了Grok 4.7在通用能力、垂直领域和终端任务上的表现差异,并指出其定位尴尬:能力虽接近头部但未突破,低价策略又面临性价比更高的国产模型挤压。文章同时揭露了马斯克预期管理失灵的过程,从早期高调宣称“超越所有”到最终定位为“便宜好用”,展现了AI竞赛中硬件和训练工艺的巨大挑战。适合关注AI行业竞争格局、模型评测、以及科技企业商业策略的读者。原文 ↗

核心观点
  • Grok 4.7相比前代有显著进步,但综合能力未触及第一梯队(Anthropic Fable 5.1和OpenAI GPT-6 Astra),处于“第二梯队第一名”的尴尬位置。
  • Grok 4.7的低价策略(输入2美元/百万Token,输出6美元/百万Token)在对比国产模型时优势不明显,加上严重的“过度思考”导致Token输出膨胀,实际开销可能更高。
  1. 01在CursorBench 4.0(46.3%)、DeepSWE v1.1(71.0%)等测试中超越GPT-5.6 Sol Max,但低于Fable 5.1 Max。
  2. 02在Terminal-Bench 4.0测试中得分38.0%,远低于Fable 5.1(57.9%),是其与第一梯队模型差距最大的维度之一。
  3. 03在电气工程EEBench(64.0%)、法律Harvey Legal Agent(19.6%)等垂直领域取得领先,得益于引入SpaceX的星链遥测数据等独家工程数据进行训练。
  4. 04Grok 4.7价格仅为GPT-5.6 Sol Max的1/3到1/2,为Fable 5.1 Max的1/5到1/8,但高于DeepSeek V4 Pro、GLM-5.3等国产模型。
  5. 05The New Stack指出,Grok 4.7平均每项任务输出8.1万个Token,远超Grok 4.6的3.6万个,低价优势因输出膨胀而削弱。
  6. 06马斯克从8月中旬高调宣称“将超过市面上所有模型”,到9月21日发布时定位为“便宜好用”,期间经历多次延期和降调,预期管理失灵。
反方 / 局限
  • 文章暗示,Grok 4.7在通用基准和长时程推理上的表现,可能被其垂直领域的亮眼成绩所掩盖(如EEBench/Harvey的成功),缺乏全面的第一梯队实力。
  • 文章指出,Grok 4.7的“过度思考”问题不仅是技术缺陷,更可能侵蚀其低价策略的商业逻辑,使其在与众多平价竞品(尤其国产模型)的价格战中处于不利地位。
9 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

延伸追问