7.5
深览指数
科技腾讯新闻·虎嗅APP··AI 生成

美国版DeepSeek交卷了

Reflection AI 发布首个开放权重模型 Beam,定位服务于不愿使用中国模型的企业和政府客户。Beam 采用 MoE 架构,总参数 5000 亿、激活 230 亿,从预训练到 RL 完全自主完成,强调推理效率可达同类模型的 1/3 到 1/4。文章揭示了 Reflection 创业战略的转向:原本押注西方开放模型会持续领先,但因 DeepSeek 等中国模型的崛起,被迫自研基础模型。其核心启示是,前沿大模型的竞争正从预训练 Scaling 转向强化学习 Scaling,且开源模型的地缘政治属性愈发凸显。适合关注 AI 模型竞争格局、开源/闭源路线之争的深度读者。原文 ↗

核心观点
  • ▍Reflection AI 的 Beam 模型定位明确:为不愿或无法使用中国模型、同时又希望拥有和自主控制 AI 能力的企业与政府客户,提供一个美国本土的开放权重模型体系。
  • ▍Reflection 创业之初原计划不自研基础模型,而是站在西方开放模型上做强化学习;但因 DeepSeek V3 等中国模型迅速拉开差距且西方迟迟未有足够强的开放模型出现,被迫转向自研。
  1. 01Beam 采用 MoE 架构,总参数约 5000 亿,推理时只激活约 230 亿参数;对比 DeepSeek-V3 总参数 6710 亿、激活 370 亿;Kimi K2 总参数 1 万亿、激活 320 亿;智谱 GLM-4.5 总参数 3550 亿、激活 320 亿。
  2. 02Reflection 强调 Beam 从预训练阶段开始完全自主完成(没有蒸馏),并针对 Coding、推理和 Agent 任务重点训练;预训练数据达 23.8 万亿 Token(对比 DeepSeek-V3 的 14.8 万亿、Kimi K2 的 15.5 万亿)。
  3. 03Beam 完成了大规模 RL 训练,使用 10500 张 Nvidia GB300 GPU 连续运行 4 周,生成超过 1 亿次 Rollout;官方称在相似难度推理任务上,Token 消耗与推理计算量仅为 GLM 5.3、GPT-6 Luna 等的 1/3 到 1/4。
  4. 04Reflection 成立不到两年,累计融资超 40 亿美元,其中 Nvidia 投资约 8 亿美元;与 Nebius 签署超 10 亿美元算力协议,与 SpaceX 签至 2029 年的算力协议(自 7 月起每月支付 1.5 亿美元)。
  5. 05Reflection 官网称将参与美国能源部 Genesis Mission 科研计划,为美国国家实验室提供开放模型;今年 3 月与韩国新世界集团签署合作备忘录,计划建设 250MW 的 AI 数据中心,提供主权 AI 服务。
  6. 06OpenRouter 排名显示,在开放模型中,排名靠前的产品大量来自 DeepSeek、智谱、小米、腾讯等中国公司,全球开放模型重心正向中国倾斜。
  7. 07Reflection 创始人为前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou,后者是 AlphaGo 核心团队成员,两人均参与过 Gemini 1 和 1.5 相关工作。
  8. 08Reflection 的商业模型不仅是开放权重,而是“模型 + 推理 + 软件栈 + 基础设施 + 企业部署”,主要客户为大型企业、政府机构、公共部门和主权 AI 客户。
反方 / 局限
  • — 文章未直接承认反方或自身局限。
7 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问