8.6
深览指数
科技虎嗅·胡说成理··AI 生成

GPT-6已经这么强,为什么我们还不肯叫它AGI?

本文深入剖析了「AGI为何仍无公认定义」这一核心问题。作者梳理了AGI概念的起源、OpenAI合同中的利益博弈,以及四派主要玩家(OpenAI、Chollet、DeepMind、Anthropic)对AGI截然不同的定义标准。文章的核心贡献在于指出:GPT-6 Astra虽在「自主完成复杂工作」「意外发明符号系统」等维度上取得突破,但六项权威评测给出了六个矛盾结果,且分歧本身恰恰证明AGI尚未到来。适合关心AI前沿进展、想理解行业标准之争而非追求情绪化结论的读者。原文 ↗

核心观点
  • AGI从来不是一个可以被发现的事实,而是一个需要被约定的标准,且人类至今未完成这个约定;分歧(如六项评测给出六个方向)本身就证明AGI尚未到来。
  • GPT-6 Astra最重要的跨越不是“会做”,而是“做完”——它第一次能将写代码、查资料、设计、叙事、编排等多个工种的能力整合成一件可交付的成品。
  1. 01ARC Prize最新测试中,Astra在96%的关卡里操作次数比人类中位数少一半,且在被丢进从没玩过的游戏时,自己发明了一套类似代数的符号系统来记录局面。
  2. 02Astra在开放式数学问题上产出了十个新结果(其中一个1999年悬而未决),并附上了机器可逐步核验的249页手稿,这比GPT-5时代的“误读文献”事件有本质改进。
  3. 03Astra学会了判断何时停下询问人类,例如在制作转行求职网站时,20秒后主动问“你要转去哪个行业?”,而上一代模型闷头做了13分15秒。
  4. 04OpenAI使用了“循环深度”技术,让信息在相同网络层中反复循环推理,部分过程不落成可读文字,导致模型“思考”的窗口在变窄。
  5. 05同一时间,公司三位高管给出三种说法:奥特曼称年底前有内部系统可称AGI;Greg Brockman说“欢迎来到AGI时代”;首席研究官Mark Chen称走完80%。
反方 / 局限
  • 上述所有正面案例均来自与OpenAI有合作或拿到提前权限的人士,官方演示片段也标注了是压缩过的,独立第三方验证仍然匮乏。
  • Astra虽然发明了记号,但该记号不能跨轮、跨模型复用,用完即毁,因此它仅是“私人速记”而非真正促成文明的“文字”。
  • 在依赖性系数从50%提升到80%时,Astra独立工作的时间从12小时骤降至70分钟,其能力上限高度依赖于使用者对可靠性的容忍度。
  • 旧金山的AI管理门店“Luna”实验显示,Astra(及同类模型)的判断力不足以为后果负责:一线员工迟到27次一律批准,四个月亏损6.2万美元。
27 分钟 · 4 卡片 · 9 资料
读原文 →

前置背景

技术原理

平行视角

未来推演