7.2
深览指数
科技微博·机器之心Pro··AI 生成

Claude Code到底有多费token?对比实验来了:三大框架最多差30倍

Composio 团队用同一模型在三个 agent 框架(Claude Code、Hermes、Kimi Code)下执行 28 个相同任务,发现成功率相近(20-22/28),但 token 消耗悬殊:Claude Code 中位数达 34 万 token,是 Kimi Code(6.1 万)的近 6 倍,成本差距达 9 倍。Writer 论文进一步证实,仅替换编排层即可平均降本 41%。结论是,Agent 竞赛下半场比的是「谁更省」,而省钱的秘密不在模型,在 harness(编排层)。适合对 Agent 成本优化、技术选型有关注的 AI 从业者或研究者阅读。原文 ↗

核心观点
  • Agent 任务的成本瓶颈不在模型,而在 harness(编排层);换 harness 比换模型更能节省成本,且成功率基本持平。
  • Claude Code 的 harness 在 token 消耗上显著高于 Kimi Code 和 Hermes,中位数用量是 Kimi Code 的 6 倍,成本是后者的 9 倍。
  1. 01Composio 团队用 Kimi K3 模型,在 28 个相同任务上测试了三个 harness:Kimi Code 成功 22 个,Hermes 成功 21 个,Claude Code 成功 20 个,成功率差距不大。
  2. 02中位数 token 消耗:Kimi Code 约 6.1 万,Hermes 约 6.7 万,Claude Code 约 34 万,差距最大可达 30 倍。
  3. 03按 Kimi K3 模型每百万输入 token 3 美元价格估算,平均每个任务成本:Kimi Code 0.22 美元,Hermes 0.28 美元,Claude Code 2 美元。
  4. 04中位数耗时:Hermes 最快(179 秒),Kimi Code 297 秒,Claude Code 348 秒。最快与最省 token 的 harness 并不重合。
  5. 05Sebastian Raschka 复现观察:Claude Code 在成功率相近时,token 用量是其他 harness 的 2-3 倍;日志显示差异主要来自输入 token,输出 token 并未显著增加。
  6. 06Writer 论文控制变量实验:固定 6 个基础模型和 22 个企业任务,仅替换编排层,平均成本降低 41%(0.21→0.12 美元),延迟缩短 44%,Token 消耗减少 38%,任务完成质量基本持平。
  7. 07Claude Code 在某次任务中,25 轮交互内输入 token 约 57.8 万,输出 token 仅约 4500,说明 token 浪费主要来自多轮交互中反复注入大量上下文历史。
反方 / 局限
  • 实验未明确控制各 harness 在任务难度分布上的差异,也未讨论 Claude Code 的消费设计是否在某些复杂任务中有意为之以换取更高可靠性。
  • 文章虽指出 harness 影响大,但未讨论不同 harness 能力边界(如支持的模型、工具链、可扩展性)对任务选择的影响,以及成本优化是否可能牺牲了某些用例中的性能上限。
5 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问