7.2
深览指数
产品Bestblogs·硅谷101··AI 生成

张阔:用真实商业任务检验 AI 系统

阿里国际站总裁张阔复盘 AI 电商 Agent 半年进展,核心发现是模型在通用榜单上逼近满分,但处理 107 个真实电商任务时,无人干预下的通过率仅约 61%。他提出 Agent = Model × Harness × Context 的公式,认为三者缺一不可;通过帕累托最优路由将简单任务分配给低成本模型,XWork 的成本仅为 Codex 与 Claude Code 的三分之一。文章还讨论了 AI 对 SaaS 的影响、中美电商生态差异,以及最终商业判断仍应留给人。数据具体、框架清晰,但立场偏向厂商。适合关注 AI 落地、电商产品与企业软件的人士阅读。原文 ↗

核心观点
  • ▍通用榜单上的高分无法代表真实业务中的可用性;前沿模型在阿里国际站 107 个真实电商任务中的无人干预通过率仅为 61%。
  • ▍垂直 AI Agent 的能力由模型、工程框架和上下文三者相乘决定,缺一不可;二十多年积累的交易与行业数据是其护城河。
  1. 01阿里国际站团队从百万级真实经营与问答数据中整理出 107 个电商任务并开源,覆盖采购比价、船期预订、交易纠纷等七大类,分为 L1-L4 难度。
  2. 02在无人干预、最前沿模型条件下,107 个任务的通过率约为 61%。
  3. 03XWork 通过帕累托最优路由,将简单任务分配给小尺寸或高性价比模型,复杂任务交由前沿模型,跑完 107 个任务的成本约为 3.69 美元,而 Codex 和 Claude Code 均在 9 美元以上。
  4. 04成本通过集约采购、模型后训练、推理服务及工程与上下文优化来压低。
  5. 05多 Agent 建议冲突时,应以经营目标为准做取舍。
  6. 06AI 产品第一天就是全球化的,但工具、平台与区域上下文仍需适配。
反方 / 局限
  • — 文章中提到的“71个任务中,最后有7个是从Copilot到agent阶段不能跑通的”,暗示部分任务结构复杂,现有Agent架构能力有限。
  • — 作者没有讨论AI Agent在更复杂、非结构化决策任务(如新市场开拓)上的适用性,其论证主要基于重复性经营任务。
5 分钟 · 5 卡片 · 8 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问