8.4
深览指数
科技虎嗅·智远同学··AI 生成
kimi不是DeepSeek时刻
Kimi K3 因需求过大导致新用户订阅暂停,与用户抱怨其“贵”和“慢”形成矛盾。文章深入分析,指出K3的“便宜”并非纯粹省算力,而是建立在稀疏专家、缓存、压缩三重技术之上,这些技术的前提是高性能网络和大规模集群。作者认为,价格战可以反转,但新一代模型对算力集群的形态要求已定,这解释了为何标价低却用停售,并分析了对产业链(HBM、光模块、超节点)的具体影响。原文 ↗
核心观点
- ▍Kimi K3的“便宜”不是纯粹省算力,而是建立在稀疏专家、缓存、压缩三重技术之上,而这些技术的前提是高性能网络和大规模集群,这解释了为何标价低却因需求过大而停售。
- ▍标价砍半的模型、用到停售的需求、翻倍的任务账单,这三件事共同指向一个核心事实:这一代最强模型的算力形态已经定死,且是按份供应的。
- 01K3是混合专家模型,896个专家,每个token只激活16个,通过稀疏性省算力,但前提是all-to-all通信对带宽和延迟极其敏感,需要64卡或更多加速器组成的supernode。
- 02K3借助Mooncake架构,编程场景缓存命中率超过90%,实际输入价格仅为标价的四分之一,但这建立在集群内部大规模搬数据的能力上,网络带宽是效率变量。
- 03K3用自研的KDA线性注意力压缩缓存,官方说法是“即使在大模型规模和长上下文条件下,也能以很有竞争力的token价格提供服务”。
- 04DeepSeek-V3解码阶段最小部署单元是320卡,K3推荐64卡起步,而上一代K2是16卡,开源旗舰模型的“最小服务单元”在代际之间显著变大。
- 05SemiAnalysis的判词指出K3需要“更多的GPU、HBM、DRAM和网络”,而HBM产能是限制国产算力集群扩张的关键瓶颈。
- 06OpenRouter官方博客称,2025年2月起,agent产生的流量超过了人类,单条agent请求消耗约是人类的15倍,驱动了总需求上涨。
反方 / 局限
- — 作者承认,一家公司停售只是一个样本,不等于一个趋势。月之暗面自身卡买少了、需求里掺着补贴、K3订阅套餐定价能否覆盖推理成本也是问号,这些因素都可能导致停售和价格计算失真。
- — 效率提升(如K3输出token比上一代少21%、DeepSeek V4走稀疏注意力省算力、华为UB-Mesh论文减少光模块使用)是另一股力量,与总需求增长形成赛跑,最终结果不确定。
11 分钟 · 3 卡片 · 9 资料
读原文 →