7.5
深览指数
科技微博·机器之心Pro··AI 生成

Claude自我进化突然变快:半年时间,从1%到26%

Anthropic 披露了其内部 AI 研发自动化程度的关键指标:截至 2026 年 8 月,Claude 已主导 26% 的研发工作,而半年前这一比例不到 1%。文章基于 Anthropic 的 R&D Automation Index,详细解释了 AL0-AL5 自动化分级标准,并提供了内部运行着约 3 万个 AI Agent、每月产生超 10 亿次决策等具体画面。区别于常见的“AI 写代码占比”讨论,这个指标更接近“AI 在多大程度上接管了研发决策与执行链条”。适合关注 AI 自我改进进程、前沿实验室内部运作的投资人、AI 从业者及科技战略研究者阅读。原文 ↗

核心观点
  • Anthropic 内部,AI 模型研发的自动化进程正在加速:截至 2026 年 8 月,26% 的 AI 研发工作已由 Claude 主导(AL4 级别),而半年前(2026 年 2 月)这一比例不到 1%。
  • 超过 90% 的 AI 研发工作已至少达到 AI 协作(AL3)阶段,人类在研发循环中的角色正在从“执行者”快速向“监督者与决策者”转变。
  1. 01Anthropic 建立了 R&D Automation Index,通过 Claude 分析员工每周工作记录,整理出 1.5 万项具体任务,并构建了包含 542 个节点的研发工作树,然后由独立 Judge 对每项任务进行 AL0-AL5 分级。
  2. 02在 Anthropic 最主要的内部 Agent 平台上,任意时刻约有 3 万个 AI Agent 正在进行研究和工程工作。
  3. 032026 年 8 月,这些 Agent 产生了超过 10 亿次决策,其中大约 0.002% 被在线监控系统阻止。
  4. 04Anthropic 为每个 Agent 建立了持续的“身份”,Agent 之间通过开放的共享消息系统进行沟通,可以互相委派任务和纠错。
  5. 05在用于 AI 研发的算力中,大约 6% 被划分为安全研究;若只看由 AI 驱动的 AI 研发,安全研究所占计算量约为 12%。
反方 / 局限
  • Anthropic 承认“AI 协作”和“AI 主导”的边界带有主观性,该指标体系并非完全可靠,若不同公司公布同类数据,需要统一方法论并经第三方验证。
  • Anthropic 强调目前没有任何被测量的 AI 研发工作达到 AL5 级别(AI 完全自主),26% 的主导比例不意味着“完全无人监管”。
8 分钟 · 5 卡片 · 12 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问