7.5
深览指数
科技腾讯新闻·虎嗅APP··AI 生成
美国版DeepSeek交卷了
Reflection AI 发布首个开放权重模型 Beam,定位服务于不愿使用中国模型的企业和政府客户。Beam 采用 MoE 架构,总参数 5000 亿、激活 230 亿,从预训练到 RL 完全自主完成,强调推理效率可达同类模型的 1/3 到 1/4。文章揭示了 Reflection 创业战略的转向:原本押注西方开放模型会持续领先,但因 DeepSeek 等中国模型的崛起,被迫自研基础模型。其核心启示是,前沿大模型的竞争正从预训练 Scaling 转向强化学习 Scaling,且开源模型的地缘政治属性愈发凸显。适合关注 AI 模型竞争格局、开源/闭源路线之争的深度读者。原文 ↗
核心观点
- ▍Reflection AI 的 Beam 模型定位明确:为不愿或无法使用中国模型、同时又希望拥有和自主控制 AI 能力的企业与政府客户,提供一个美国本土的开放权重模型体系。
- ▍Reflection 创业之初原计划不自研基础模型,而是站在西方开放模型上做强化学习;但因 DeepSeek V3 等中国模型迅速拉开差距且西方迟迟未有足够强的开放模型出现,被迫转向自研。
- 01Beam 采用 MoE 架构,总参数约 5000 亿,推理时只激活约 230 亿参数;对比 DeepSeek-V3 总参数 6710 亿、激活 370 亿;Kimi K2 总参数 1 万亿、激活 320 亿;智谱 GLM-4.5 总参数 3550 亿、激活 320 亿。
- 02Reflection 强调 Beam 从预训练阶段开始完全自主完成(没有蒸馏),并针对 Coding、推理和 Agent 任务重点训练;预训练数据达 23.8 万亿 Token(对比 DeepSeek-V3 的 14.8 万亿、Kimi K2 的 15.5 万亿)。
- 03Beam 完成了大规模 RL 训练,使用 10500 张 Nvidia GB300 GPU 连续运行 4 周,生成超过 1 亿次 Rollout;官方称在相似难度推理任务上,Token 消耗与推理计算量仅为 GLM 5.3、GPT-6 Luna 等的 1/3 到 1/4。
- 04Reflection 成立不到两年,累计融资超 40 亿美元,其中 Nvidia 投资约 8 亿美元;与 Nebius 签署超 10 亿美元算力协议,与 SpaceX 签至 2029 年的算力协议(自 7 月起每月支付 1.5 亿美元)。
- 05Reflection 官网称将参与美国能源部 Genesis Mission 科研计划,为美国国家实验室提供开放模型;今年 3 月与韩国新世界集团签署合作备忘录,计划建设 250MW 的 AI 数据中心,提供主权 AI 服务。
- 06OpenRouter 排名显示,在开放模型中,排名靠前的产品大量来自 DeepSeek、智谱、小米、腾讯等中国公司,全球开放模型重心正向中国倾斜。
- 07Reflection 创始人为前 Google DeepMind 研究员 Misha Laskin 和 Ioannis Antonoglou,后者是 AlphaGo 核心团队成员,两人均参与过 Gemini 1 和 1.5 相关工作。
- 08Reflection 的商业模型不仅是开放权重,而是“模型 + 推理 + 软件栈 + 基础设施 + 企业部署”,主要客户为大型企业、政府机构、公共部门和主权 AI 客户。
反方 / 局限
- — 文章未直接承认反方或自身局限。
Reflection AIMisha LaskinIoannis AntonoglouBeamDeepSeek-V3智谱 GLM 5.2阿里 Qwen 3.8-MaxKimi K3MoE 架构强化学习 ScalingNvidiaNebiusSpaceX美国能源部韩国新世界集团主权 AI
7 分钟 · 4 卡片 · 12 资料
读原文 →