7.3
深览指数
科技人人都是产品经理·AI星球··AI 生成
GPT-6 Astra 深度评测:当 AI 开始自己干活
本文评测了 OpenAI 于 2026 年 9 月发布的旗舰模型 GPT-6 Astra。核心变化是 AI 从“给答案”转向“自己干活”,能直接操作浏览器、办公软件和开发工具完成多步骤任务。文章提供了详细的官方数据,包括 ARC-AGI-3 基准达 99.9% 的接近满分成绩,以及上手体验、竞品对比和定价分析。适合想了解 AI agent 最新进展、评估其商业价值或技术实用性的深度读者,文章内容详实但部分数据依赖官方自测,需读者自行判断其可靠性。原文 ↗
核心观点
- ▍GPT-6 Astra 的核心变化是从聊天问答转向自主完成任务,AI 竞争的标尺从“谁更会聊”变成了“谁真能把事办成”。
- ▍Astra 的能力提升是代际性的,而非挤牙膏式的小修小补,体现在数学、抽象推理和计算机操作三大领域的基准分数同时跃升。
- 01Astra 在 ARC-AGI-3 抽象推理基准上得分从 7.8% 跃升至 99.9%,几乎打满。
- 02在 OSWorld 2.0 计算机操作任务中,Astra 的任务完成率为 72.6%,平均耗时从 75 分钟降至 40 分钟。
- 03Astra 采用分层协作架构,分为上层(目标与授权边界)、中层(规划与跨上下文记忆)和下层(工具调度),使其能执行长任务而不失忆。
- 04越权率实测为 0%,是迄今最对齐的模型,但其强网安能力因此受限开放,普通用户拿不到完整权限。
- 05API 标准定价为每百万输入 10 美元、输出 50 美元,是上一代旗舰 GPT-5.6 Sol 的 2.5 倍。
- 06上下文窗口为 105 万 token,知识截止于 2026 年 4 月 30 日。
反方 / 局限
- — 思考过程更不透明,OpenAI 首席科学家已将可监控性列为后续挑战,这使得用户难以追踪其决策原因。
- — 部分基准分数可能使用了配套的测试工具(harness),包含了系统红利而非纯模型能力,这一点有待独立复测验证。
14 分钟 · 5 卡片 · 15 资料
读原文 →