7.6
深览指数
科技微博·机器之心Pro··AI 生成

首个统一元递归自我改进架构,让AI「变强的方式」本身变强

MetaRSI-v1 提出全球首个统一 Data-RSI、Harness-RSI、Model-RSI 的元递归自我改进架构,将自我改进从「模型变强」升级为「让模型变强的方式」也变强。论文来自 CosmosMind 及斯坦福、伯克利、MIT、清华等十余所高校。核心贡献是定义了一套名为 Loop Kernel 的统一形式化框架,将进步抽象的闭环统一抽象出来,并提炼出五条定律。实验显示,一个 30 亿参数小模型在四项基准上平均提升 10.9 分;六款前沿旗舰模型平均提升 7.3 分。适合对 AI 前沿架构和递归自我改进方向有基础认知的研究者、技术决策者阅读。原文 ↗

核心观点
  • MetaRSI-v1 提出首个统一 Data-RSI、Harness-RSI、Model-RSI 的元递归自我改进架构,将自我改进作用于 RSI 自身,使「让模型变强的方式」也随过程进化,进入自我改进的「平方时代」。
  • 核心贡献是定义了一个与对象无关的抽象形式化框架——Loop Kernel,将任何自我改进过程统一抽象为「消费反馈 → 在 Data/Harness/Model 上提出改动 → 验证器裁决 → 回流为信号」的闭环,从而使不同 RSI 方案可以统一调度组合。
  1. 01在 Qwen3.5-35B-A3B(3B 激活参数)上,MetaRSI-v1 四基准(Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond 高难度子集、AIME)平均提升 10.9 分,其中 SWE-bench Pro 解决率接近翻倍。
  2. 02在 Claude Opus 5、GPT-5.6 Sol 等六款前沿旗舰模型上,启用 Data 与 Harness 算子后平均提升 7.3 分。
  3. 03整套架构由四个 Agent(Transition Agent、RSI² Agent、RSI² Sub-Agent、MetaRSI² Agent)协调运作,形成三层 RSI 嵌套:算子改进目标系统,双轴编排改进算子用法,元层改进双轴编排策略。
  4. 04Harness 拆分出 System Prompt、Skill、MCP、Tools、Memory 五个可插拔槽位,Data-RSI 暴露的问题经内化变成 Harness 冗余后,Harness-RSI 可做减法删除冗余,实现能力留下、成本退场。
  5. 05团队同步开源了 RSI-Harness 和 Genome 开放社区,希望为不同科学领域沉淀可移植的 Harness Genome。
反方 / 局限
  • 作者明确承认「循环不凭空创造能力」——一切增益本质上都是外部信息熵的输入或已有能力的激发与重组。这意味着 MetaRSI 并未解决「能力从哪里来」的根本问题,其提升幅度必然受到模型已有能力天花板和验证器质量的限制。
  • 文章提及「可信度由不可写面度量」——在闭环内部无法区分「真正能力变强」和「放宽了成功标准」带来的分数提升,这种偏差从内部无法察觉、无法靠统计纠正。这是 RSI 系统一个尚未被根本解决的可靠性问题。
  • 实验仅覆盖了特定模型家族(Qwen、OpenAI、Anthropic、Kimi)有限测试集,在不同领域、不同任务类型及是否能覆盖「验证器无法自动化」的场景仍需更多验证。
8 分钟 · 6 卡片 · 14 资料
读原文 →

概念锚点

前置背景

平行视角

争议局限

未来推演

延伸追问