7.7
深览指数
科技腾讯新闻·CTO范凯··AI 生成

GPT-6 Astra 真这么强吗?我用自己真实工作流来告诉你答案

作者基于自身真实工作流(办公总结、写稿、编程),对 GPT-6 Astra 进行了与 DeepSeek V4 和 GPT-5.6 的对比实测。核心发现:Astra 在中文长文输出和写作上进步巨大,已能与 DeepSeek 并列第一梯队;但关键在于「松着用」,其在宽松 Agent (Pi) 下的表现远好于受 Codex 严格管控的表现。作者指出,模型能力越强,旧的 Agent 规则越可能成为限制,建议用户升级模型后也应「清着用」,重新审视已有指令。原文 ↗

核心观点
  • GPT-6 Astra 在中文总结和创作上已追上 DeepSeek V4,成为综合能力最强的旗舰模型之一,但其强大性能发挥的前提是「松着用」,即避免使用像 Codex 这样过度严格的 Agent 来限制它。
  • 模型能力越强,旧的 Agent 规则和 Skill 越可能成为拖累;用户需要随着模型升级「清着用」,重新审视并精简已有的指令集。
  1. 01在办公实测中,Astra 配 Pi 对近 300K 的新闻日报做总结,其分类合理度、细节保留和脉络梳理能力均超过 DeepSeek V4 和 GPT-5.6。
  2. 02在写作实测中,作者将其与 DeepSeek V4、GPT-5.6 对比,并让 Astra 自评「能否直接口播」,结果 DeepSeek 8.8 分第一,Astra 配 Pi 以 8.5 分紧随其后,而配 Codex 只有 8.0。
  3. 03在编程实操中,Astra 作为架构师制定方案并审查代码,由 GPT-5.6 执行,成功跑通改版项目(+14000行,-2900行),但代价高昂,作者账号剩余周额度从 60% 掉到 19%。
  4. 04OpenAI Codex 负责人 Eric Provencher 公开发文建议用户减少项目中的 Skill 数量,因为更强大的模型不再需要旧有的严格规则,这佐证了作者的「松着用」观点。
反方 / 局限
  • Astra 的使用成本极高,短期内无法替代 GPT-5.6 或 DeepSeek 用于高频、低价值的任务,只能被用于关键决策和架构设计等高价值场景。
  • 测试结果依赖于作者特定的工作流和 Prompt 设计,尤其是 Pi 和 Codex 的 Agent 差异,其他用户在使用不同 Agent 或场景时结论可能不同。
10 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问