科技腾讯新闻··AI 生成
黄仁勋为何力挺梁文锋、杨植麟?
本文深入分析了中国AI大模型公司在高端GPU断供的背景下,如何通过系统性重构Transformer架构(注意力机制、残差连接、优化器)来突破算力与数据双重瓶颈。文章指出,由算力围墙逼出的技术创新,如MoE、MLA、KDA等,正在改写全球AI的算力与存储账单,并反向影响英伟达等芯片巨头的商业逻辑。适合关注AI技术前沿、产业格局与中美科技博弈的深度读者阅读。原文 ↗原文 ↗
核心观点
- ▍中国大模型公司通过系统性重构Transformer架构(注意力机制、残差连接、优化器),在算力围墙内实现了密集的技术创新,这些创新正在反向改写全球算力与存储的成本结构。
- ▍黄仁勋力挺中国开源模型,是因为开放权重能维持英伟达芯片的广泛需求,而闭源巨头自研芯片才是其真正的威胁。
- 01Kimi K3模型将注意力换成KDA混合线性机制,残差连接换成注意力残差,优化器换成按头调节的Muon,深度学习沿用九年的“三大件”在一个模型里都被重做了一遍。
- 02DeepSeek V3训练成本约279万H800 GPU小时,约五六百万美元,而同代美国旗舰的训练预算普遍高出一个数量级以上。
- 03Kimi K3采用3:1混合架构(3层KDA线性层穿插1层全注意力),相比传统MLA基线,KV缓存最高省75%,在百万token上下文下吞吐提升6倍。
- 04Kimi K3的官方数据称,整体scaling效率约为上一代K2的2.5倍。
- 05杰文斯悖论在AI领域重现:token成本降低,但需求总量不降反升,因为更多新应用涌入。K3是压缩最狠的一代,输出价却接近K2.6的四倍。
反方 / 局限
- — MoE虽节省算力,但不省权重,K3模型权重仍有1.4TB左右,对通信和吞吐要求高,需要64卡起步,即“专家们学会了轮班,宿舍却一间不能少”。
- — 线性注意力/混合架构在规模做大后,复杂多跳推理和检索等依赖全局注意力的能力会明显吃亏,这是MiniMax在M2上“撤退”的原因。
- — 创新主要发生在中国,但标准可能留在开源社区,利润可能被内存厂、云平台和应用拿走,中国模型公司可能面临“只出售权重与token”的困境。
16 分钟 · 5 卡片 · 14 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问