7.3
深览指数
科技腾讯新闻·AI未来指北··AI 生成

一只鹈鹕成了Agent时代最大的明星

文章以社区用户用“鹈鹕骑自行车”测试AI模型为切入点,生动揭示了AI大模型在进入Agent阶段后面临的核心矛盾:模型能力波动(降智)对重度用户的自动化工作流产生实质性影响。作者指出,用户感知的“降智”并非简单权重变更,而是推理强度、上下文管理、资源调度等多层因素的综合结果。文章核心贡献在于提出了“智力SLA”概念——模型公司除提升峰值能力外,还需解决“持续稳定供应高水平智能”这一新竞争维度。适合AI从业者、Agent应用开发者或对大模型商业化有深度兴趣的读者。原文 ↗

核心观点
  • AI模型(以GPT-6 Astra为例)在进入Agent阶段后,能力波动(降智)已成为阻碍其进入生产流程的核心痛点,未来模型公司的竞争将从峰值能力延伸到如何稳定、规模化供应高水平智能(即“智力SLA”)。
  1. 01社区用户用“鹈鹕骑自行车”这种直观任务测试模型,发现GPT-6 Astra在不同推理强度下生成的鹈鹕图像存在显著质量波动(如车轮位置错乱、动作穿帮)。
  2. 02一位参赛者基于Astra制作了长达30分钟、一镜到底的骑行动画,该作品涉及页面架构、动画逻辑、时间系统、人物运动等复杂环节,展示了Astra在开放任务上的峰值能力。
  3. 03CodexRadar开源项目吸引超过500名志愿者贡献百亿级Token,通过112道真实编程题监测模型表现,反映重度用户对能力波动的普遍焦虑。
  4. 04一位大模型算法工程师反馈,GPT-6降智会导致自动化任务积累并发冲突,错误可能经中枢传播破坏整个仓库。
  5. 05OpenAI于9月10日暂停了每月200美元的Pro 20x套餐新订阅,该套餐提供约为Plus 20倍的使用额度,暗示Astra的供给压力。
  6. 06Astra API标准价格为每百万输入Token 10美元、输出Token 50美元,其最受欢迎的Computer Use和多Agent工作流能力非常消耗算力。
反方 / 局限
  • 文章承认“鹈鹕测试”并非严格的科学benchmark,且存在模型被反复测试后“熟悉”该任务的潜在问题,降低了其作为通用评估工具的信效度。
  • 目前没有公开证据表明OpenAI主动将Astra替换为更弱的底模,用户的“降智”体感可能更多源于资源调度、限制或上下文管理,而非模型权重本身变化。
9 分钟 · 5 卡片 · 12 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问