科技腾讯新闻·钛媒体APP··AI 生成
实测Kimi K3:强得意外,慢得着急
本文通过实测对比Kimi K3与GPT-5.6 Sol在3D生成、前端编程、物理仿真等场景的表现,指出K3在视觉审美和3D能力上突出,但生成速度慢、一次性准确率不足。文章还分析了月之暗面的商业模式、融资节奏与IPO前景,探讨了开源模型如何通过开发者生态转化为API收入。适合关注国产大模型能力边界与商业变现的读者。原文 ↗原文 ↗
核心观点
- ▍Kimi K3在视觉审美和3D生成能力上比肩甚至超越GPT-5.6 Sol,但生成速度慢和一次性准确率不足是明显短板,是一款“能力上限高但体验未跟上”的模型。
- 01Kimi K3拥有2.8万亿参数、原生视觉理解能力、100万Token上下文窗口,是全球首个开源的3万亿级别模型。
- 02在Arena Code Arena榜单上,Kimi K3以1679分排全球第一,超过Claude Fable 5的1631分和GPT-5.6 Sol的1618分。
- 03实测中,K3生成的3D迷宫游戏、莫奈风格全景世界在视觉上更有辨识度,而GPT-5.6 Sol更强调完成效率和稳定性。
- 04K3在杯子倒水物理仿真中首次生成失败(水粒子穿透杯壁),经提示后才修正,而GPT-5.6 Sol一次通过。
- 05K3生成同一场景的时间约为GPT-5.6 Sol的两到三倍,视频剪辑耗时近两小时。
- 06Kimi K3 API输入价格每百万Token 20元,输出100元,价格虽低于海外旗舰,但相比上一代K2.6,输入价格涨了3倍多,输出涨了近4倍。
- 07月之暗面6月底启动新一轮融资,投前估值315亿美元,Kimi的ARR在6月中旬达到3亿美元,三个月内增至3倍。
反方 / 局限
- — 官方承认K3对历史思考内容敏感,中途切换模型可能导致输出质量下降;训练偏向长程高难任务,面对简单问题时容易替代用户做决定。
- — 文章实测发现K3在物理仿真等工程可靠性场景中存在“翻车”,需要多次提示修正,且速度慢于竞品,表明其“工程可靠性”仍有短板。
16 分钟 · 5 卡片 · 14 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问