7.4
深览指数
科技Bestblogs·硅基观察Pro··AI 生成

YC 最新判断:Harness 比模型更重要

YC 最新判断认为,AI 竞争的胜负手正从模型能力转向 Harness(运行框架)。文章通过 ARC-AGI-3 测试、Prime Agent 和 OpenJarvis 实验等具体案例,论证了 Harness 通过优化提示词、工具调用、记忆管理和权限运维,能显著提升模型实际表现,甚至弥补不同模型间的能力差距。对于关注 AI 工程化、Agent 落地和模型应用的技术决策者,本文提供了一个重要的认知框架:模型决定上限,但 Harness 决定谁能摸到上限。原文 ↗

核心观点
  • AI 竞争的胜负手正从模型能力转向 Harness(运行框架),模型决定能力上限,而 Harness 决定能否触达该上限。
  1. 01ARC-AGI-3 测试证明,同样的模型在不同 Harness 下得分可差出 35.9 个百分点。
  2. 02Prime Agent 采用“信息分层”设计,将信息分布于上下文、REPL 编程环境和外部存储中,实现长周期任务的连续状态保持。
  3. 03OpenJarvis 实验显示,通过系统层面的 Harness 优化,本地小模型能显著追回与云端大模型之间的性能损失,且运行成本极低。
  4. 04YC 内部开发的 QM(Queue Manager)系统负责 Agent 的规模化部署、状态集中管理与资源调度。
  5. 05企业级场景下,Harness 的重心转向运维与权限管理,以解决“主角综合征”(多个 Agent 争夺单一服务)和信息泄露风险。
反方 / 局限
  • 文章主要聚焦于 Harness 的优势,对 Harness 自身可能带来的复杂性和运维开销(如信息分层与状态管理的工程成本)着墨不多,也未深入探讨当模型能力跃迁(如达到 AGI)后,Harness 是否会重新成为次要角色。
3 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

应用场景

平行视角

延伸追问