8.1
深览指数
科技人人都是产品经理·Z Finance··AI 生成

翁荔连更2篇博客:谨慎对待Scaling Law,Harness将重构AI演进范式

前OpenAI安全研究副总裁翁荔在个人博客连续发表两篇长文,核心观点是:被行业奉为圭臬的Scaling Laws,其拟合过程比想象中更脆弱,存在参数计数方式、数值精度、拟合区域选择等bookkeeping级漏洞,且“数据无限”的前提正遭遇现实挑战;同时提出AI的第二增长曲线在于“Harness Engineering”——围绕基础模型构建的执行系统,而非继续堆砌参数和数据。文章通过大量研究案例和交互式模拟器,论证了从模型竞争到系统竞争的范式转向。适合关注AI前沿技术、模型架构与工程实践的高阶读者。原文 ↗

核心观点
  • Scaling Laws的拟合过程存在多种bookkeeping级漏洞,包括参数计数方式、loss函数计算细节、数值精度和实验规模选择,这些看似微小的决定会扭曲对千亿、万亿参数模型表现的预测,且‘数据无限’的前提正遭遇真实数据枯竭的挑战。
  • AI的第二条增长曲线在于‘Harness Engineering’——围绕基础模型构建的执行系统,通过工作流自动化、文件系统持久记忆和子代理等范式,实现模型的自我改进和闭环反馈,而非继续堆砌参数和数据。
  1. 01Kaplan和Chinchilla两种Scaling Laws的分歧,很大程度上来自参数计数方式:Kaplan排除embedding层,Chinchilla则计入,这个选择直接扭曲了拟合曲线的指数。
  2. 02Epoch AI团队复现Chinchilla时发现两个bug:Huber loss使用平均值而非总和导致优化器过早收敛;关键参数保留两位小数,但达到该精度理论上需要约60万次实验,而实际仅跑了不到500个模型。
  3. 03Weng在文章中嵌入了交互式模拟器,演示Scaling Laws的三种失效模式:loss精度舍入、loss噪声扰动、拟合区域选择,这些在小规模实验中不可见,但外推时误差会被指数级放大。
  4. 04数据重复导致‘双重下降’现象:当重复数据比例上升时,测试loss在训练中段出现平坦甚至上升;Lovelace等2026年工作证明模型越大,对重复数据越敏感,‘数据无限’前提正在崩塌。
  5. 05Weng将Harness类比为操作系统,封装工具调用、状态管理、错误恢复等复杂流程,其核心设计范式包括:工作流自动化(如Codex的循环执行)、文件系统作为持久记忆、子代理和后台任务并行执行。
  6. 06Harness让模型形成自我改进闭环的三个要素:可验证的外部反馈(如代码测试是否通过)、经过筛选和压缩的持久记忆、以及能改变未来行为的策略更新。
  7. 07上下文工程从ACE(手工设计更新规则)演进到MCE(元层面分离机制与内容),再到Meta-Harness(优化Harness本身的代码),优化对象从指令提示向优化器代码迁移。
反方 / 局限
  • Weng没有否定Scaling Laws的价值,认为其对于通用语言能力、跨领域知识和基础推理能力的提升仍然有效,只是强调其拟合本身存在脆弱性,且‘数据无限’前提正在崩塌。
  • Weng指出,许多Harness改进最终会被内化到核心模型行为中(如手动prompt技巧在指令微调后变得不那么核心),但外部接口与工具交互层将始终存在,Harness的‘元方法论’进化路径本身也在探索中。
  • 文章未充分讨论Harness工程的工程复杂度、成本分叉(小公司能否负担定制化Harness)、以及其本身可能引入的新的系统脆弱性——如子代理并行执行中的错误传播和状态同步问题。
20 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

未来推演