科技Bestblogs·青稞AI··AI 生成
LoRA 一作、OpenAI o1 核心成员的新工作:首次公开 397B 模型的 Agent RL 训练配方
这是一份关于大规模 Agent 强化学习(RL)训练的系统性工程实践报告,由 Mercor 与 SkyRL 团队(含 LoRA 一作与 OpenAI o1 核心成员)联合发布。文章首次公开了从任务环境治理(Harness)、Token 对齐(TITO)、分布式训练调优到 397B 模型完整训练的链路,并给出量化结果:Pass@1 从 16.11% 提升至 27.29%。核心结论是,Agent RL 的下一步突破更依赖于工程环境治理(修 Harness、对齐 Token),而非算法选型。适合正在从事大模型后训练、Agent 产品化或分布式 RL 系统的工程师与研究者阅读,以厘清高 ROI 投入方向。原文 ↗原文 ↗
核心观点
- ▍大规模知识工作 Agent 的强化学习训练,本质是系统工程问题:环境(Harness)、数据管道(Token 对齐)、推理基础设施的治理优先级,远高于 RL 算法的选择(GRPO/PPO/DPPO)。
- 01仅修复沙箱包缺失、PDF 工具布局、API 超时等 Harness 问题,未训练模型就获得 5.95 个百分点的奖励提升,相当于一个 Epoch 的训练收益。
- 02Prompt Mean 聚合策略(同 Prompt 的 Rollout 内部聚合后再跨 Prompt 平均)是全文效果最好的单项算法改动,平均奖励再提升 3.85 个百分点,解决了超长轨迹主导梯度的问题。
- 03Token-in-Token-out(TITO)方案避免了多轮 Agent 因文本重建 Token 序列导致的 Off-policy 隐蔽问题,确保训练动作与推理实际采样完全一致。
- 04完整训练后,Qwen3.5-397B-A17B 在 APEX-Agents 基准上 Pass@1 从 16.11% 提升至 27.29%(相对提升 ~70%),35B 版本在训练后超过 Claude Opus 4.5。
- 05DPPO 相对于 GLM-5 Loss 的直接奖励提升不显著(仅 0.34 个百分点),但改变了 Agent 行为模式:从长输出转为短思考-调工具-看结果-再思考的交互模式。
- 06跨 Harness 迁移实验(Archipelago→OpenCode→Terminus)显示收益可部分迁移,但大模型(397B)对 MCP 工具的偏好会影响泛化效果。
- 07使用 32 个有奖励方差的任务进行小规模过拟合验证,发现文件 Diff 评分失败源于文件提取不完整和 Diff 工具不准,更换第三方工具后才出现学习信号。
反方 / 局限
- — 文章承认跨 Harness 迁移实验中,397B 模型因对 MCP 工具的偏好导致迁移效果弱于 35B 模型(后者因代码执行比例上升而迁移更好),暗示大模型规模本身可能增加对特定工具模式的过拟合风险。
概念锚点
前置背景
平行视角
未来推演
延伸追问