8.1
深览指数
科技人人都是产品经理·深流研究所··AI 生成

AGI 怎样才算真的来了?

GPT-6 Astra 在 ARC-AGI-3 上取得 99.9% 的高分,引发 OpenAI 总裁等人宣布“AGI 时代到来”,但 ARC Prize 团队澄清并未宣称这就是 AGI。文章认为,这一争议的核心在于 AGI 定义模糊且被各方用于叙事竞争:OpenAI 以经济价值定义 AGI,Anthropic 强调风险与能力绑定,DeepMind 则构建可测量的认知维度体系。作者指出,将模型发布包装成“AGI 到来”是一种强大的产品叙事,尤其有利于英伟达等算力供应商维持投资预期;真实的通用智能可能不会以某个标志性节点出现,而是平滑地融入现有增长曲线。适合关注 AI 产业、模型评测与商业叙事博弈的深度读者。原文 ↗

核心观点
  • AGI 是否到来并非单纯的技术判断,而是一场各方争夺叙事主导权的商业与舆论博弈。模型公司、算力供应商等利益相关方,利用 AGI 定义的模糊性,将模型升级包装成历史节点,以影响资本、人才和产业预期。
  1. 01GPT-6 Astra 在 ARC-AGI-3 上的 99.9% 高分,是接入 OpenAI 专用适配框架(允许保留隐藏推理状态)后的成绩,在标准测试框架下得分仅为 62.7%。
  2. 02GPT-6 Astra 在其余评测中表现不均匀:FrontierMath Tier 4 达 97.6%,计算机操作测试 OSWorld 2.0 达 72.6%,但更接近真实办公流程的 AutomationBench 降至 41.4%,复杂专业任务测试 Agents' Last Exam 为 59.3%。
  3. 03OpenAI 2018 年公司章程将 AGI 定义为“在大多数具有经济价值的工作上超越人类的高度自主系统”,以经济产出为核心尺度,不要求意识或情感。
  4. 04Anthropic 更常用“强大的 AI”,描述为在多数重要领域达到或超越顶尖专家水平、可独立完成数小时至数周任务、并能大规模复制的系统,将能力扩展与风险治理绑定。
  5. 05Google DeepMind 2023 年发布《Levels of AGI》框架,以性能和通用性为轴划分为五级;2026 年 3 月进一步发布十个维度的认知分类框架,并设奖金征集评测方案。
  6. 06黄仁勋在宣布 AGI 已到来的同时,强调训练 Astra 使用的英伟达系统及下一代 GPU,暗示大规模算力投入产生了智能跃迁,隐含“更大规模算力投入仍然必要”的因果链。
  7. 07黄仁勋并非首次宣布 AGI 到来:2024 年预测五年内可实现,2026 年 3 月在播客中又称“我认为我们已经实现了 AGI”。
反方 / 局限
  • 文章暗示,ARC Prize 团队的声明(“我们并不声称它就是 AGI”)对叙事的约束力有限,因为定义权的分散让任何一方都难以单方面终结争论。
  • 作者引用 Karpathy 的观点,指出 AGI 可能不会以明确的拐点到来,而是平滑融入增长,事后找不到标志性瞬间——这与双方阵营执着于“宣布”形成张力。
9 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问