5.4
深览指数
产品量子位··AI 生成

百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军

百度文心助手任务Agent在PinchBench v2评测中以94.6%的最高分超越Claude、GPT等模型,获得总榜第一。该评测侧重于智能体在真实工作场景中完成复杂任务链并交付可验证结果的能力,而非传统模型的问答知识。文章通过财报分析、安全漏洞修复、合同审查等具体案例展示了Agent的实操能力,并指出其成功源于百度在意图理解与搜索引擎架构上的长期积累。适合关注AI Agent落地进展、产品技术实力对比的读者。原文 ↗

核心观点
  • 百度文心助手任务Agent在PinchBench v2评测中以最高分94.6%登顶,领先Anthropic Claude Opus 4.8-fast(93.5%)和OpenAI GPT-5.6-luna(88.7%),成为首个以正式产品身份获得该榜单第一的国产智能体系统。
  1. 01PinchBench v2评测包含23个真实工作场景和147项任务,覆盖数据分析、代码开发、办公自动化等七大类别,采用自动化校验与LLM评审双轨机制,全程零人工干预。
  2. 02在GitLab Q3 2025财季利润率计算任务中,Agent自主检索财报原文,定位非GAAP运营利润率约18%,计算出超出指引约500个基点,五个自动化评分维度全部满分。
  3. 03在Node.js安全漏洞分析任务中,Agent识别出express RCE和JWT bypass两个CRITICAL级漏洞为P0,并按优先级制定五批次修复计划,LLM评审给出满分。
  4. 04文章声称文心助手任务Agent的成功源于百度在意图理解上二十余年的积累,其框架与搜索引擎的底层逻辑一脉相承:接收意图、拆解任务、调用工具、验证结果。
反方 / 局限
  • 文章为百度官方或授权转载内容,属于PR软文,未提及任何反方观点、模型自身局限或评测潜在争议(如评测设计是否偏向百度任务场景)。
7 分钟 · 4 卡片 · 7 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问