7.4
深览指数
科技虎嗅·字母AI··AI 生成

Gemini 4 Pro疑似泄露,“AI减速”又成空话

Google 疑似在盲测平台 Arena 匿名测试下一代旗舰模型 Gemini 4 Pro,其编码、Agent 能力远超现款 Flash,甚至压制了预期的 GPT-6 和 Claude Fable。这揭示出更关键的趋势:前沿实验室已在实际推进“递归自我改进”(RSI),即 AI 参与制造更强 AI。尽管 Dario Amodei 等领袖近期公开呼吁“减速”,但出于竞争压力,各家实际都在加速迭代,减速倡议已沦为口头共识。适合关注 AI 产业动态与前沿技术伦理的深度读者,用以校准对 AI 发展速度的真实判断。原文 ↗

核心观点
  • AI 前沿实验室并未实质性减速,各家(谷歌、Anthropic、OpenAI)的新一代旗舰模型均已进入测试阶段,减速倡议沦为空洞的公开表态。
  • “递归自我改进”(RSI)是推动模型加速迭代的真正关键驱动力,而不仅仅是模型参数或算力的简单堆砌。
  1. 01LMSYS Arena 出现名为 gemini-3.8-flash 但表现远超官方的模型,被社区普遍认为是 Google 下一代旗舰 Gemini 4 Pro 的匿名测试。
  2. 02开发者 Qwinah 声称“幽灵路由”到后端,显示内部标识含 G4P-ARGON,上下文窗口超 1000 万 token,具备跨会话记忆、网络访问和机器人控制能力。
  3. 03社区流传的 benchmark 对比图显示,Gemini 4 Pro 在 DeepSWE (88.7%)、Terminal-Bench (95.3%) 等测试中大幅超过 GPT-6 Astra 和 Claude Fable。
  4. 04路透社 8 月报道,Google 联合创始人 Sergey Brin 推动将递归自我改进(RSI)列为重点方向;Google 在 3.8 Flash 发布时也提到“递归地评估和改进底层模型”。
  5. 05Anthropic 公开数据,截至 8 月 Claude 已能主导 26% 的 AI 研发任务;智谱 GLM-5.3 的 Infra Agent 也参与了自身推理基础设施的优化。
  6. 06OpenAI 后台出现 gpt-6-sol 模型名,Anthropic 社区出现 Opus 5.2 灰度痕迹,三大实验室下一代模型均已进入测试。
反方 / 局限
  • 关于 Gemini 4 Pro 的 benchmark 图与 Qwinah 的后端截图信息不一致,且 Astra 的得分与官方数据不符,所有数据均无官方背书,真实性存疑。
  • 文章暗含的张力:各方领袖(Altman、Hassabis)虽口头上认同 Amodei 的“减速”倡议,但行动上持续加速,暗示“囚徒困境”式的竞争格局短期内无解。
16 分钟 · 3 卡片 · 9 资料
读原文 →

前置背景

平行视角

延伸追问