8.1
深览指数
科技人人都是产品经理·Timothy··AI 生成
Agent 评测观止:一文讲透 AI 智能体评测的底层原理与产品落地
文章指出 Agent 评测正经历从“说得对不对”到“世界有没有改变”的范式转移,核心难点在于:Agent 的多步执行、动作副作用、非确定性等特性,使得传统的 Chatbot 评测方法失效。作者系统拆解了结果分与轨迹分的二分法,介绍了 pass@k 与 pass^k 这对关键指标,并提供了从出题、搭环境、选裁判到定门禁的完整方法论。适合正在构建或评估 AI Agent 产品的产品经理、算法工程师和架构师阅读,能帮助其建立一套可落地、能指导上线决策的评测体系。原文 ↗
核心观点
- ▍Agent 评测的核心范式转移:从 Chatbot 时代评判“它说得对不对”,转向评判“世界有没有按它说的改变”,成败判定必须锚定环境终态而非对话轨迹。
- 01一个订票 Agent 在演示中声称“已预订成功”,但订单数据库为空,说明仅凭对话记录判断任务完成会被欺骗。
- 02Sierra 团队的 τ-bench 论文显示,GPT-4o 级别的函数调用 Agent 在零售客服场景单次通过率约 61%,但同一批任务独立跑 8 次、全部成功的概率不到 25%。
- 03OSWorld 基准测试中,最强模型在 2024 年只能完成 12.24% 的任务,但此后分数大幅上升;然而,METR 的随机对照试验显示,使用 2025 年初的 AI 编程工具后,开发者平均慢了 19%,说明基准进步不等于产品价值。
- 04Anthropic 在 2026 年量化了基建噪声:评测机器资源配置的差异,能在 Terminal-Bench 2.0 上造成 6 个百分点的分差,超过榜单头部模型之间的差距。
- 05文章提供了 Agent 评测成本估算公式:单轮评测成本 ≈ 任务数 T × 试次 k ×(单试次输入 token × 输入单价 + 单试次输出 token × 输出单价),并给出一个 30 任务 × 4 试次的估算案例,一轮约 25 美元。
反方 / 局限
- — 自建评测有边界:品味测不出来、方向感测不出来、评测会腐坏(模型换代、用户分布漂移、题目老化会使其失效)。
- — 公开榜单的分数可能混入训练数据污染和测量噪声,当基准被“刷”到八成以上,剩余失败多来自坏题和环境噪声,不能直接反映模型能力。
τ-benchpass^kpass@kAnthropicMETRSierraOSWorldSWE-benchCORE-BenchTerminal-BenchAgentQuestOpenAILangfuse
29 分钟 · 4 卡片 · 10 资料
读原文 →