7.7
深览指数
科技微博·机器之心Pro··AI 生成
阿里荣膺 ACL 2026 最佳资源论文奖,揭示AI Agent的专家能力鸿沟
阿里巴巴 ATH-MaaS 团队因构建 HSCodeComp 基准获得 ACL 2026 最佳资源论文奖。该基准针对跨境电商海关编码(HS Code)这一真实专家级场景,发现当前最强 AI Agent 在应用层级规则时准确率仅约 49.4%,远低于人类专家的 95%。文章揭示了 Agent 在层级规则应用这一 Level 3 能力上的结构性瓶颈,并指出单纯扩大模型规模或增加推理深度(Tes-Time Scaling)无法弥合差距,关键在于检索并严格应用专家规则与判例。适合关注 AI Agent 能力边界、大模型在专业场景落地的技术从业者与研究者阅读。原文 ↗
核心观点
- ▍当前最强 AI Agent 在「层级规则应用」这一专家级任务上存在结构性瓶颈,单纯靠模型规模扩展或推理深度增加(Test-Time Scaling)无法弥合与人类专家之间的巨大差距。
- 01在 HSCodeComp 基准上,表现最好的 Agent 在 10 位海关编码上的 Exact Match Accuracy 仅为约 49.4%,而从业十年的人类专家可达 95%,差距接近腰斩。
- 02HSCodeComp 基准包含 632 个真实商品,覆盖 32 个大类,由 26 位平均从业 5 年以上的关务专家按六步工作流标注,最终专家分歧率仅约 2%。
- 03评测了 28 个最先进系统,包括 GPT-5.5、Claude-Opus-4.8、GLM-5.2、DeepSeek-V4-Pro、Qwen3.7-Max 等基础模型和各种 Agent 框架(Manus、Gemini Deep Research 等),最强 Agent 甚至仅勉强超过传统专家规则决策树系统(约 45.0%)。
- 04两种标准的 Test-Time Scaling 策略均告失效:多数投票几乎不带来提升,自我反思也非常微弱;推理漂移(Reasoning Drift)现象显示,强迫模型想得更多(增大 reasoning effort)反而导致准确率下滑。
- 05驱动性能的关键因素按重要性排序为:规则/知识检索(地基,+8.5pt) > CROSS 历史裁定库(一致且稳定,+5~10pt) > 视觉信息(边际补充,仅对强 VLM 有效,+4pt)。
- 06基于基准的洞见,团队在 6k 条专家标注数据上做 SFT 和 Agentic RL 训练,将 Qwen 为基座的 Agent 提升至约 65%,虽大幅领先最强通用 Agent,但距离人类专家的 95% 仍有明显差距。
反方 / 局限
- — 文章虽指出层级规则应用是结构性瓶颈,但未深入讨论该瓶颈的根本原因——Transformer 架构的注意力机制是否天然不适合处理严格、非连续的层级约束。
- — 作者承认即便经过专项优化的 Agent 系统(65%)仍远低于人类专家(95%),但未充分探讨人类专家是否可能依赖的隐性知识(如与海关官员的沟通经验、对行业惯例的直觉)是 Agent 难以通过检索和规则应用获得的。
17 分钟 · 3 卡片 · 9 资料
读原文 →