7.9
深览指数
科技腾讯新闻·白鲸实验室··AI 生成

5亿Token实测Kimi K3:我看到了核弹,也看到高昂的成本

作者通过一天时间、消耗5亿Token,对Kimi K3进行了4个真实复杂任务的Coding测试,并与GPT-5.6 Sol同台PK。核心结论是:K3在复刻《GTA5》时表现惊艳,对游戏机制的理解深度超过了GPT-5.6 Sol,这得益于其背后的Agent Harness(尤其是Vision in the Loop功能),让AI能“看”到并修正视觉结果,形成更完整的开发闭环。但K3并不稳定,视频复刻任务失败,且存在Token消耗超高、生成速度慢、额度限制严格等问题,导致实际使用成本高昂。文章认为K3为Agent而生,代表了AI Coding从“写代码”到“执行任务”的范式转变,但离真正的“AI软件工程师”仍有差距。适合深度使用AI Coding工具的软件工程师、技术决策者阅读。原文 ↗

核心观点
  • Kimi K3的核心价值不在于其3万亿参数和Benchmark分数,而在于其背后的Agent Harness系统,尤其是Vision in the Loop功能,让AI能像工程师一样检查并修正视觉结果,这是其Coding能力提升的关键。
  • K3已展现出从“单轮问答”转向“长期自主执行”的Agent能力,但离真正的“AI软件工程师”仍有差距,尤其在需要深度理解软件设计意图和复杂系统逻辑的任务上。
  1. 01作者花费一天时间、消耗5亿Token,测试了4个真实复杂任务,包括复刻《GTA5》、视频复刻游戏、设计Agent专用软件等,是全网Token消耗量最大、Coding最深入的测试之一。
  2. 02在复刻《GTA5》的PK中,K3一次性生成了可用性和完整度极高的网页游戏,其警察系统更是惊艳,能理解追捕逻辑并生成触发机制(警车、警察、直升机、探照灯),细节远超GPT-5.6 Sol。
  3. 03作者认为K3优于GPT-5.6 Sol的关键在于Agent Harness,其中Vision in the Loop功能让Agent在写代码后能打开网页截图、观察视觉效果并自我修正,避免了以往AI Coding“只写代码不看效果”的缺陷。
  4. 04K3的Token消耗极高,单个任务生成时长超过40分钟,一个测试日的消耗就占用了699元最高档会员40%的额度,作者估算其单个任务成本是GPT-5.6 Sol的两倍,且额度限制远多于GPT。
  5. 05K3在视频复刻任务中失败,将视频拆帧理解导致偏差放大,未能复刻《滚动的天空》的核心玩法和节奏感。
反方 / 局限
  • K3能力不稳定,存在‘抽卡’问题:在3个网页游戏测试中,仅GTA5任务成功,另外两个任务均失败。
  • 高昂的Token消耗和严格的额度限制,使得K3在大量真实工作中难以被普通用户负担,其商业可用性存疑。
  • K3在需要理解全新软件设计意图(如为Agent设计剪辑软件)时表现不佳,需要大量人工介入修正,说明它尚未完全理解‘软件为什么这样设计’。
11 分钟 · 3 卡片 · 9 资料
读原文 →

前置背景

平行视角

未来推演