8.0
深览指数
科技智东西··AI 生成
00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本
MIT等机构研究发现,固定基础模型回答开头的两个Token(如“. Okay”),即可让数学推理成绩接近甚至超过对应的强化学习版本。以Olmo-3-7B为例,固定该开头后MATH-500准确率从42%升至78%,超过其RL版本的75%。该发现揭示了强化学习的一大部分作用可能是提高模型选择有效推理开头的概率,而非重塑其核心推理能力。适合对LLM推理机制、强化学习本质感兴趣的AI研究者与高级从业者阅读。原文 ↗
核心观点
- ▍基础模型答错题,有时并非不会做,而是未进入解题状态;强化学习的一部分作用,可能是让模型更容易选择有效的回答开头,而非重塑其推理能力。
- 01固定Olmo-3-7B的开头为“.\n\nOkay”后,MATH-500准确率从42%升至78%,超过其强化学习版本的75%。
- 02固定Qwen3-14B的开头为“ Alright,”后,准确率从72%提高到87%,与强化学习版本持平。
- 03正确答案中约50%以“.\n\n”开头,错误答案中仅14%;强化学习将“.\n\nOkay”的生成概率从0.14提高到0.65。
- 04将训练数据中的“Okay”替换为“Chicken”后,固定“.\n\nChicken”开头的准确率从18%升至77%(使用100B-token重训),证明线索效果源于训练数据中的词语关联。
- 05将训练数据中的“step by step”替换为“duck duck goose”后,“Think duck duck goose”也能像“Think step by step”一样诱导模型推理。
反方 / 局限
- — 实验仅验证了Olmo-3-7B和Qwen3-14B两个模型,其他模型上效果未知,方法有效性取决于具体模型和任务。
- — 不同回答开头在安全测试中表现差异显著:“. Okay”可能呈选择性拒绝,“Okay,”则可能增加对危险请求的遵从,说明该方法在安全对齐上有不确定性。
麻省理工学院(MIT)加州大学伯克利分校华盛顿大学艾伦人工智能研究所(Ai2)索菲·L·王(Sophie L. Wang)阿米尔·德拉维德(Amil Dravid)Olmo-3-7BQwen3-14BMATH-500GSM8KAMC 23AIME 2024HumanEvalRL-ZeroICMLNeurIPS
12 分钟 · 4 卡片 · 7 资料
读原文 →