7.6
深览指数
科技腾讯新闻··AI 生成
xAI正式发布Grok 4.7,还是没赶上这一代顶尖模型
马斯克xAI发布Grok 4.7,参数量达2.1万亿,API价格相比第一梯队极具优势,但在多项关键基准测试中,其综合能力仍落后于Anthropic Fable 5.1和OpenAI GPT-6 Astra。文章详细分析了Grok 4.7在通用能力、垂直领域和终端任务上的表现差异,并指出其定位尴尬:能力虽接近头部但未突破,低价策略又面临性价比更高的国产模型挤压。文章同时揭露了马斯克预期管理失灵的过程,从早期高调宣称“超越所有”到最终定位为“便宜好用”,展现了AI竞赛中硬件和训练工艺的巨大挑战。适合关注AI行业竞争格局、模型评测、以及科技企业商业策略的读者。原文 ↗
核心观点
- ▍Grok 4.7相比前代有显著进步,但综合能力未触及第一梯队(Anthropic Fable 5.1和OpenAI GPT-6 Astra),处于“第二梯队第一名”的尴尬位置。
- ▍Grok 4.7的低价策略(输入2美元/百万Token,输出6美元/百万Token)在对比国产模型时优势不明显,加上严重的“过度思考”导致Token输出膨胀,实际开销可能更高。
- 01在CursorBench 4.0(46.3%)、DeepSWE v1.1(71.0%)等测试中超越GPT-5.6 Sol Max,但低于Fable 5.1 Max。
- 02在Terminal-Bench 4.0测试中得分38.0%,远低于Fable 5.1(57.9%),是其与第一梯队模型差距最大的维度之一。
- 03在电气工程EEBench(64.0%)、法律Harvey Legal Agent(19.6%)等垂直领域取得领先,得益于引入SpaceX的星链遥测数据等独家工程数据进行训练。
- 04Grok 4.7价格仅为GPT-5.6 Sol Max的1/3到1/2,为Fable 5.1 Max的1/5到1/8,但高于DeepSeek V4 Pro、GLM-5.3等国产模型。
- 05The New Stack指出,Grok 4.7平均每项任务输出8.1万个Token,远超Grok 4.6的3.6万个,低价优势因输出膨胀而削弱。
- 06马斯克从8月中旬高调宣称“将超过市面上所有模型”,到9月21日发布时定位为“便宜好用”,期间经历多次延期和降调,预期管理失灵。
反方 / 局限
- — 文章暗示,Grok 4.7在通用基准和长时程推理上的表现,可能被其垂直领域的亮眼成绩所掩盖(如EEBench/Harvey的成功),缺乏全面的第一梯队实力。
- — 文章指出,Grok 4.7的“过度思考”问题不仅是技术缺陷,更可能侵蚀其低价策略的商业逻辑,使其在与众多平价竞品(尤其国产模型)的价格战中处于不利地位。
xAI埃隆·马斯克Grok 4.7Anthropic Fable 5.1OpenAI GPT-6 AstraSpaceXCursorBenchTerminal-BenchDeepSeek V4 ProGLM-5.3Kimi K3
9 分钟 · 3 卡片 · 8 资料
读原文 →