7.9
深览指数
科技量子位··AI 生成
Meta新研究:字节模型蒸馏后,天花板破了
Meta FAIR 与华盛顿大学联合研究提出,在知识蒸馏中将学习单位从 Token 转为 Byte,能突破传统蒸馏的性能天花板。他们设计了两种映射方法将教师模型的 Token 概率分布转换为字节级分布,其中 End-Of-Token 方案在实验外推中比传统 Token 蒸馏的下游平均准确率上限高出 4 个百分点,且存储与训练数据量需求更低。该工作挑战了 Token 模式的主导地位,但推理计算成本更高、尚未完成同等算力下的公平比较。适合关注大模型训练效率与架构创新的 AI 从业者深读。原文 ↗
核心观点
- ▍在知识蒸馏中,将学习单位从 Token 转为 Byte,可以突破传统 Token 蒸馏的性能上限,End-Of-Token 方案在外推中比 Token 蒸馏平均准确率高 4 个百分点。
- 01传统 Token 蒸馏(以 Llama 3-8B 为教师)的预测平均准确率上限为 48.4%,而字节级蒸馏的 End-Of-Token 方案达 52.4%。
- 02字节只有 256 种基础取值,远小于 Llama 3-8B 的 128256 个 Token 词表,使得完整概率分布更容易保留,无需 top-k 截断。
- 03Marginalize-It 通过聚合再归一化将 Token 分布转换为字节分布,但会丢掉一部分已结束 Token 的概率信息;End-Of-Token 则在每个 Token 后加入特殊符号 ,保留完整概率。
- 04在 Scaling 曲线外推中,End-Of-Token 约在 6.33×10²² FLOPs 时追平 Token 蒸馏 48.4% 的预测上限。
- 05字节级蒸馏处理的实际文本量约为 Token 方案的六分之一,存储量约为五分之一。
反方 / 局限
- — End-Of-Token 在每个 Token 后加入特殊符号,处理相同文本量时训练计算量比普通字节模型高出约 30.94%,推理成本同样更高。
Meta FAIR华盛顿大学Kalyani MaratheArtidoro PagnoniLuke ZettlemoyerMarginalize-ItEnd-Of-TokenLlama 3-8BToken 蒸馏字节级蒸馏BPBScaling Law
15 分钟 · 4 卡片 · 7 资料
读原文 →