产品Bestblogs·硅谷101播客··AI 生成
E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔
阿里国际站总裁张阔以 Accio Work 的实践解释,模型在编程等可验证任务上的进步,并未等比例转化为跨境电商商家体验。核心原因是商业 Agent 的反馈周期长、数据分散,其效果取决于模型、工程框架和企业上下文三者的乘积。他提出用 107 个真实业务任务来评测 Agent,前沿模型无人干预通过率约 61%。访谈强调,AI 能加速执行,但产品品味、市场判断和最终商业责任仍须由人承担。适合关注 AI 落地瓶颈、Agent 产品设计及人机协作边界的从业者阅读。原文 ↗原文 ↗
核心观点
- ▍商业 Agent 比编程 Agent 更难评估,因为数据分散且结果反馈慢,模型测评的进步并未简单转化为用户可感知的体验提升。
- ▍Agent 的效果并非仅由模型决定,而是模型能力、工程框架和企业上下文三者的乘积,缺一不可。
- 01张阔团队构建了包含 107 个任务的电商评测集,覆盖报价、钓鱼邮件识别、订船、纠纷等场景。
- 02在无人干预条件下,最前沿的模型在这套评测集上的通过率约为 61%。
- 03跨境电商的反馈周期长达数周,单次操作正确不等于业务成功;而编程任务结果可即时通过编译器验证。
- 04Accio Work 的方向从采购搜索扩展至产品设计、找工厂、样品、运输和多平台经营等更长链条的任务。
- 05文章提及了报价中识别钓鱼邮件、订船和纠纷处理等可被 RMS 等工具验证的具体任务。
- 06实践中尝试了低成本模型路由,即简单任务由小模型处理,复杂任务才调用大模型。
反方 / 局限
- — 访谈中提到的具体成效(如效率提升比例)和成本数字主要来自阿里国际站的自述,缺乏独立的第三方验证。
- — 评测集覆盖 107 个任务已算细致,但与真实世界中无限变化的商业场景相比,仍是一个有限集合,其通过率与实际商业成功率之间可能存在差距。
- — 讨论主要聚焦于 Agent 替代重复性执行工作,对于 Agent 在创新性、策略性任务(如市场进入时机选择)上的辅助能力着墨不多。
概念锚点
前置背景
平行视角
未来推演
延伸追问