7.7
深览指数
科技微博·机器之心Pro··AI 生成

清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华大学联合多机构研究揭示,在在线策略蒸馏中,单道训练题通过反复采样可覆盖全量数据71.5%的状态空间,恢复70%以上性能增益。核心矛盾在于数据供给过剩而模型吸收速率极低——无论题目数量多少,模型每步吸收的监督比例基本不变。作者提出新视角:评估训练数据应关注其能否将模型导向未探索状态,而非题目数量或难度本身。适合关注大模型训练效率与算法原理的研究者与从业者。原文 ↗

核心观点
  • OPD的核心矛盾是“数据撑死,算法饿死”:单道题通过反复rollout可覆盖全量71.5%的状态空间并恢复72%的全数据增益,但模型吸收监督的速度不受题目数量影响,且随训练推进持续衰减。
  • 评估OPD训练数据的核心标准应是“题目能否将学生模型带到未访问过的状态”,而非题目难度、数量或多样性。
  1. 01数学任务上,单题训练300步时恢复全量OPD增益的87%,缩小69%初始师生差距;1000步时恢复比例降至72%,与全量差距约3分。
  2. 02一道题反复rollout在100步时已覆盖65.9%的参考状态簇,300步时达71.5%;加入16道来自不同语义簇的题目后,状态覆盖率达98.9%,验证结果与全量相当。
  3. 03学生模型“吸收率”(每次更新吃掉剩余距离的比例)随训练单调下降,且1题、4题、16题、全量17k题四个run在300步时的吸收率在78%-84%之间,几乎不受题目数量影响。
  4. 04在coding、instruction following、agentic tool use三个任务上,单题训练分别缩小了73%、66%和64%的初始师生性能差距;效果对训练题的性质(难度、是否曾被解出)几乎不敏感。
  5. 05极端压力测试中,连不成题的“空模板”和“闲聊提示”也能带来与真实数据基线相当的训练增益,且只用了三分之一到一半的rollout token。
  6. 06在Multi-teacher OPD(MOPD)设置下,每个领域只需16道语义不同的题目即可打平全量MOPD性能。
反方 / 局限
  • OPD与RLVR存在天花板差异:RLVR不受教师分布束缚,有潜力超越教师;而OPD受限于匹配教师分布,可能无法探索超出教师能力的状态空间。
  • 单题训练在1000步内未追上全量数据(68.4 vs 72.1),300步后两条曲线保持约3分差距,说明仅靠单题无法完全替代多样数据。
  • 作者承认该工作更多是“提出问题给出视角”而非“给答案”,状态视角是否适用于其他on-policy训练范式尚待验证。
11 分钟 · 5 卡片 · 13 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问