7.4
深览指数
科技腾讯新闻·未尽研究··AI 生成
Harness递归进化,通往AI新前沿
文章以OpenAI为GPT-5.6 Sol在ARC-AGI-3基准测试中部署优化Harness框架的事件为引子,提出「模型能力主义」正在被挑战,模型智能正从参数内部扩展为「模型与运行环境共同产生的智能」。作者进一步论证,Harness正从Agent工程中的执行框架演变为「智能运行时」,并指出其终极方向是让Harness自身进入反馈、评估和优化的递归循环,即从「智能体上下文工程」走向「元上下文工程」。文章适合对AI Agent架构、模型推理效率及前沿技术路线有深度兴趣的读者,提供了一个从工程实践视角审视AI能力提升的新框架。原文 ↗
核心观点
- ▍模型智能正从「参数内部的智能」扩展为「模型与运行环境(Harness)共同产生的智能」,Harness的优化是提升AI实际能力的关键路径。
- ▍Harness 优化的终极方向是让优化过程本身自动化,即从「智能体上下文工程」走向「元上下文工程」,让Harness代码自身进入递归优化循环。
- 01GPT-5.6 Sol在ARC-AGI-3基准测试中得分仅为7.8%,远低于预期,OpenAI团队归因于未部署最优的Harness框架。
- 02ARC-AGI-3官方Harness在每次行动后不保留模型内部推理状态,导致模型无法继承此前形成的知识积累,严重削弱能力。
- 03启用Codex的「推理保留」和「上下文压缩」机制后,GPT-5.6 Sol在ARC-AGI-3公开测试集得分提升约三倍,同时输出token减少六倍。
- 04翁荔(Lilian Weng)重返OpenAI,专注的方向正是模型递归自我改进(RSI),与文章论点直接关联。
- 05Anthropic的Claude Code源码泄露显示,其Harness框架对上下文生命周期进行了更细粒度的管理,包括剪裁、缓存、归档与压缩等机制。
- 06Claude Opus 4.6能力提升后,一些此前依赖外部脚手架的功能被模型自身能力吸收并简化,显示了Harness优化与模型能力提升的互动关系。
反方 / 局限
- — 当Harness开始拥有修改自身工具、权限和执行流程的能力时,它将构成智能系统新的安全边界,OpenAI与Anthropic的调查已揭示相关风险。
- — 从ACE到MCE的路线存在务实挑战,目前工作流设计仍主要依赖领域专家经验,实现真正的自动化优化尚有距离。
OpenAI翁荔 (Lilian Weng)AnthropicARC-AGI-3Harness递归自我改进 (RSI)GPT-5.6 SolClaude Opus 4.6Sakana AIMetaGoogleHugging FaceThinking Machines LabCodex
7 分钟 · 5 卡片 · 14 资料
读原文 →