8.0
深览指数
产品Bestblogs·硅谷101播客··AI 生成

E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

阿里国际站总裁张阔以 Accio Work 的实践解释,模型在编程等可验证任务上的进步,并未等比例转化为跨境电商商家体验。核心原因是商业 Agent 的反馈周期长、数据分散,其效果取决于模型、工程框架和企业上下文三者的乘积。他提出用 107 个真实业务任务来评测 Agent,前沿模型无人干预通过率约 61%。访谈强调,AI 能加速执行,但产品品味、市场判断和最终商业责任仍须由人承担。适合关注 AI 落地瓶颈、Agent 产品设计及人机协作边界的从业者阅读。原文 ↗

核心观点
  • ▍商业 Agent 比编程 Agent 更难评估,因为数据分散且结果反馈慢,模型测评的进步并未简单转化为用户可感知的体验提升。
  • ▍Agent 的效果并非仅由模型决定,而是模型能力、工程框架和企业上下文三者的乘积,缺一不可。
  1. 01张阔团队构建了包含 107 个任务的电商评测集,覆盖报价、钓鱼邮件识别、订船、纠纷等场景。
  2. 02在无人干预条件下,最前沿的模型在这套评测集上的通过率约为 61%。
  3. 03跨境电商的反馈周期长达数周,单次操作正确不等于业务成功;而编程任务结果可即时通过编译器验证。
  4. 04Accio Work 的方向从采购搜索扩展至产品设计、找工厂、样品、运输和多平台经营等更长链条的任务。
  5. 05文章提及了报价中识别钓鱼邮件、订船和纠纷处理等可被 RMS 等工具验证的具体任务。
  6. 06实践中尝试了低成本模型路由,即简单任务由小模型处理,复杂任务才调用大模型。
反方 / 局限
  • — 访谈中提到的具体成效(如效率提升比例)和成本数字主要来自阿里国际站的自述,缺乏独立的第三方验证。
  • — 评测集覆盖 107 个任务已算细致,但与真实世界中无限变化的商业场景相比,仍是一个有限集合,其通过率与实际商业成功率之间可能存在差距。
  • — 讨论主要聚焦于 Agent 替代重复性执行工作,对于 Agent 在创新性、策略性任务(如市场进入时机选择)上的辅助能力着墨不多。
3 分钟 · 5 卡片 · 11 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问