7.5
深览指数
科技微博·机器之心Pro··AI 生成
CC、Codex组队干活,Raven新版本既做总调度,也让Harness持续进化
EverMind 开源的 Raven V0.2.0 提出「递归自我改进(RSI)应发生在 Harness 层而非仅模型参数层」的核心观点,并围绕此理念构建了可被 AI 改写、支持多专业 Agent 协作编排的 Harness 框架。文章详细介绍了 Harness of Harnesses 架构、DAG 任务图编排、Curator 实验性自进化功能,以及四个专业 Agent(研究、编码、设计、持续执行)在多项基准上的表现。适合关注 Agent 工程实现、Multi-Agent 系统设计、以及 AI 自动化研究的开发者阅读。原文 ↗
核心观点
- ▍递归自我改进(RSI)不应只发生在模型参数层,类比人类大脑的不是 LLM,而是整个 Agent;RSI 应当、也可以发生在 Harness(将模型能力转化为行动的机制)层。
- ▍Raven V0.2.0 围绕两个核心设计构建:为 RSI 而设计的、可被 AI 改写的模块化 Harness 框架,以及统一编排专业 Agent 的 Harness of Harnesses 架构。
- 01Harness 中可被 AI 改写的四类内容:Modules(playbook 与子 Harness 组合)、Code(策略代码)、Prompt(系统提示与上岗手册)、Policy(工具开放与闸门配置)。
- 02运行时 Curator(实验性)可读取 Harness 装配、任务要求、执行留痕与用户反馈,生成对四类内容的改动,并经声明检查、装配和预检后安装,失败时触发回滚。
- 03Harness of Harnesses 将 Raven-Research、Raven-Code、Raven-Design、Raven-Oncall 与 Claude Code、Codex 等专业 Agent 统一编排,通过 DAG 任务图组织成员选择、任务拆解、依赖调度与结果交接。
- 04SWE-bench Verified 上 Raven-Code(DS-V4-Flash 组)问题解决率 91.0%,DeepSeek-Harness 与 OpenCode 分别为 90.4% 和 90.2%。
- 05在 Raven RSI 项目中,nanochat 预训练实验完成 7 轮 172 次训练,在相同单次训练预算下使 val_bpb 相对下降 5.8%。
- 06多 Agent 编排评测中,DS-V4-Flash 组 Node F1 为 0.963、Edge F1 为 0.897、Partial Order Accuracy 为 0.918、Exact Match Rate 为 0.867。
反方 / 局限
- — 文章承认 Curator 在 V0.2.0 中仍是实验性功能,目前仅在一个模拟案例中跑通多轮闭环,尚未进行跨场景、多次重复的统计验证,也未与模型参数层的慢更新打通。
EverMindRavenCuratorHarnessHarness of HarnessesRSI (Recursive Self-Improvement)DAG (有向无环图)Raven-ResearchRaven-CodeRaven-DesignRaven-OncallPlaybookEverOSClaude CodeCodexDeepSeek-HarnessSWE-bench Verifiednanochat互补学习系统理论(CLS)
21 分钟 · 5 卡片 · 10 资料
读原文 →