7.2
深览指数
科技微博·机器之心Pro··AI 生成
Claude Code到底有多费token?对比实验来了:三大框架最多差30倍
Composio 团队用同一模型在三个 agent 框架(Claude Code、Hermes、Kimi Code)下执行 28 个相同任务,发现成功率相近(20-22/28),但 token 消耗悬殊:Claude Code 中位数达 34 万 token,是 Kimi Code(6.1 万)的近 6 倍,成本差距达 9 倍。Writer 论文进一步证实,仅替换编排层即可平均降本 41%。结论是,Agent 竞赛下半场比的是「谁更省」,而省钱的秘密不在模型,在 harness(编排层)。适合对 Agent 成本优化、技术选型有关注的 AI 从业者或研究者阅读。原文 ↗
核心观点
- ▍Agent 任务的成本瓶颈不在模型,而在 harness(编排层);换 harness 比换模型更能节省成本,且成功率基本持平。
- ▍Claude Code 的 harness 在 token 消耗上显著高于 Kimi Code 和 Hermes,中位数用量是 Kimi Code 的 6 倍,成本是后者的 9 倍。
- 01Composio 团队用 Kimi K3 模型,在 28 个相同任务上测试了三个 harness:Kimi Code 成功 22 个,Hermes 成功 21 个,Claude Code 成功 20 个,成功率差距不大。
- 02中位数 token 消耗:Kimi Code 约 6.1 万,Hermes 约 6.7 万,Claude Code 约 34 万,差距最大可达 30 倍。
- 03按 Kimi K3 模型每百万输入 token 3 美元价格估算,平均每个任务成本:Kimi Code 0.22 美元,Hermes 0.28 美元,Claude Code 2 美元。
- 04中位数耗时:Hermes 最快(179 秒),Kimi Code 297 秒,Claude Code 348 秒。最快与最省 token 的 harness 并不重合。
- 05Sebastian Raschka 复现观察:Claude Code 在成功率相近时,token 用量是其他 harness 的 2-3 倍;日志显示差异主要来自输入 token,输出 token 并未显著增加。
- 06Writer 论文控制变量实验:固定 6 个基础模型和 22 个企业任务,仅替换编排层,平均成本降低 41%(0.21→0.12 美元),延迟缩短 44%,Token 消耗减少 38%,任务完成质量基本持平。
- 07Claude Code 在某次任务中,25 轮交互内输入 token 约 57.8 万,输出 token 仅约 4500,说明 token 浪费主要来自多轮交互中反复注入大量上下文历史。
反方 / 局限
- — 实验未明确控制各 harness 在任务难度分布上的差异,也未讨论 Claude Code 的消费设计是否在某些复杂任务中有意为之以换取更高可靠性。
- — 文章虽指出 harness 影响大,但未讨论不同 harness 能力边界(如支持的模型、工具链、可扩展性)对任务选择的影响,以及成本优化是否可能牺牲了某些用例中的性能上限。
5 分钟 · 4 卡片 · 12 资料
读原文 →