7.4
深览指数
科技智东西·程 茜··AI 生成

OpenAI公布GPT-5.6自进化秘籍!翁荔被曝回归

OpenAI 发布了 GPT-5.6 系列模型在自我优化方面的技术细节,包括利用 GPT-5.6 Sol 优化 GPU 内核程序,使推理成本降低 20%,并通过改进推测解码技术提升 Token 生成效率 15% 以上。文章还揭示了 GPT-5.6 Sol 在二维解谜基准 ARC-AGI-3 上表现不佳的根本原因——智能体调度框架未能保留模型的推理历史,而非模型本身能力缺陷。此外,文章报道了翁荔将重返 OpenAI 从事 AI 自进化研究、OpenAI 正在开发硬件产品以及用户规模突破 10 亿等消息。对于关注大模型系统工程、推理优化和智能体技术的从业者,这是一篇信息密度高、具有实操参考价值的文章。原文 ↗

核心观点
  • 大模型竞争已进入全栈工程化优化竞赛,通过模型自身优化推理栈和智能体调度基座,是实现低成本、高效率、规模化落地的关键路径。
  1. 01GPT-5.6 Sol 自动分析线上真实业务流量,定位负载均衡问题,测试新路由策略并迭代调度规则,最终将推理服务成本降低 20%。
  2. 02GPT-5.6 Sol 在 Triton 和 Gluon 两种开源 GPU 编程语言中自主编写并优化核心代码,优化了模型的前向传播计算。
  3. 03通过自主迭代推测解码的草稿模型,开展数百组架构对比实验,并自主值守训练流程,使整体 Token 生成效率提升 15% 以上。
  4. 04GPT-5.6 Sol 在 ARC-AGI-3 二维解谜基准上初始正确率仅 7.8%,原因是模型执行每步操作后私有推理思考过程被清空,且滚动截断窗口导致历史操作记录丢失。
  5. 05通过启用推理内容持久留存和上下文压缩两项 API 配置,模型在 ARC-AGI-3 的评测分数提升 3 倍,输出 Token 消耗量缩减至原先的 1/6。
  6. 06OpenAI 的智能体调度基座通过延迟加载、仅追加写入模式、固定有序工具信息格式等手段,管控上下文膨胀、优化工具加载机制、复用已有计算成果。
  7. 07OpenAI 用户规模首破 10 亿,服务 200 万家企业。
反方 / 局限
  • 文章未提及 GPT-5.6 Sol 自优化方法可能带来的副作用,例如模型优化可能过度拟合特定线上负载,导致在非典型场景下性能下降。
  • 文章未讨论 GPT-5.6 自进化能力对其他 AI 安全研究者的潜在影响,例如模型自主优化核心代码可能引入难以追踪的微小漏洞。
13 分钟 · 5 卡片 · 12 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问