7.1
深览指数
科技腾讯新闻·钛媒体APP··AI 生成

实测Kimi K3:强得意外,慢得着急

本文通过实测对比Kimi K3与GPT-5.6 Sol在3D生成、前端编程、物理仿真等场景的表现,指出K3在视觉审美和3D能力上突出,但生成速度慢、一次性准确率不足。文章还分析了月之暗面的商业模式、融资节奏与IPO前景,探讨了开源模型如何通过开发者生态转化为API收入。适合关注国产大模型能力边界与商业变现的读者。原文 ↗

核心观点
  • Kimi K3在视觉审美和3D生成能力上比肩甚至超越GPT-5.6 Sol,但生成速度慢和一次性准确率不足是明显短板,是一款“能力上限高但体验未跟上”的模型。
  1. 01Kimi K3拥有2.8万亿参数、原生视觉理解能力、100万Token上下文窗口,是全球首个开源的3万亿级别模型。
  2. 02在Arena Code Arena榜单上,Kimi K3以1679分排全球第一,超过Claude Fable 5的1631分和GPT-5.6 Sol的1618分。
  3. 03实测中,K3生成的3D迷宫游戏、莫奈风格全景世界在视觉上更有辨识度,而GPT-5.6 Sol更强调完成效率和稳定性。
  4. 04K3在杯子倒水物理仿真中首次生成失败(水粒子穿透杯壁),经提示后才修正,而GPT-5.6 Sol一次通过。
  5. 05K3生成同一场景的时间约为GPT-5.6 Sol的两到三倍,视频剪辑耗时近两小时。
  6. 06Kimi K3 API输入价格每百万Token 20元,输出100元,价格虽低于海外旗舰,但相比上一代K2.6,输入价格涨了3倍多,输出涨了近4倍。
  7. 07月之暗面6月底启动新一轮融资,投前估值315亿美元,Kimi的ARR在6月中旬达到3亿美元,三个月内增至3倍。
反方 / 局限
  • 官方承认K3对历史思考内容敏感,中途切换模型可能导致输出质量下降;训练偏向长程高难任务,面对简单问题时容易替代用户做决定。
  • 文章实测发现K3在物理仿真等工程可靠性场景中存在“翻车”,需要多次提示修正,且速度慢于竞品,表明其“工程可靠性”仍有短板。
16 分钟 · 5 卡片 · 14 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问