7.5
深览指数
科技微博·机器之心Pro··AI 生成

CC、Codex组队干活,Raven新版本既做总调度,也让Harness持续进化

EverMind 开源的 Raven V0.2.0 提出「递归自我改进(RSI)应发生在 Harness 层而非仅模型参数层」的核心观点,并围绕此理念构建了可被 AI 改写、支持多专业 Agent 协作编排的 Harness 框架。文章详细介绍了 Harness of Harnesses 架构、DAG 任务图编排、Curator 实验性自进化功能,以及四个专业 Agent(研究、编码、设计、持续执行)在多项基准上的表现。适合关注 Agent 工程实现、Multi-Agent 系统设计、以及 AI 自动化研究的开发者阅读。原文 ↗

核心观点
  • ▍递归自我改进(RSI)不应只发生在模型参数层,类比人类大脑的不是 LLM,而是整个 Agent;RSI 应当、也可以发生在 Harness(将模型能力转化为行动的机制)层。
  • ▍Raven V0.2.0 围绕两个核心设计构建:为 RSI 而设计的、可被 AI 改写的模块化 Harness 框架,以及统一编排专业 Agent 的 Harness of Harnesses 架构。
  1. 01Harness 中可被 AI 改写的四类内容:Modules(playbook 与子 Harness 组合)、Code(策略代码)、Prompt(系统提示与上岗手册)、Policy(工具开放与闸门配置)。
  2. 02运行时 Curator(实验性)可读取 Harness 装配、任务要求、执行留痕与用户反馈,生成对四类内容的改动,并经声明检查、装配和预检后安装,失败时触发回滚。
  3. 03Harness of Harnesses 将 Raven-Research、Raven-Code、Raven-Design、Raven-Oncall 与 Claude Code、Codex 等专业 Agent 统一编排,通过 DAG 任务图组织成员选择、任务拆解、依赖调度与结果交接。
  4. 04SWE-bench Verified 上 Raven-Code(DS-V4-Flash 组)问题解决率 91.0%,DeepSeek-Harness 与 OpenCode 分别为 90.4% 和 90.2%。
  5. 05在 Raven RSI 项目中,nanochat 预训练实验完成 7 轮 172 次训练,在相同单次训练预算下使 val_bpb 相对下降 5.8%。
  6. 06多 Agent 编排评测中,DS-V4-Flash 组 Node F1 为 0.963、Edge F1 为 0.897、Partial Order Accuracy 为 0.918、Exact Match Rate 为 0.867。
反方 / 局限
  • — 文章承认 Curator 在 V0.2.0 中仍是实验性功能,目前仅在一个模拟案例中跑通多轮闭环,尚未进行跨场景、多次重复的统计验证,也未与模型参数层的慢更新打通。
21 分钟 · 5 卡片 · 10 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问