7.1
深览指数
科技虎嗅·字母榜··AI 生成

8万亿,梁文锋也开始卷“超大”

文章指出,在大模型领域经历了一段追求效率和小型化之后,以DeepSeek、字节、阿里为代表的中国AI公司,重新将模型参数规模推向5万-10万亿级别,掀起新一轮“参数竞赛”。但这并非简单的旧路重走:MoE架构使得总参数与激活参数解耦,Agent应用的“木桶效应”则放大了大规模参数在能力覆盖面与稳定性上的优势。文章的核心判断是,多轮融资后的DeepSeek有条件“卷参数”,这与效率路线并不矛盾,而是Infra充裕后的一种自然演进。适合关注AI前沿竞争动态、模型架构演进及产业投资逻辑的读者。原文 ↗

核心观点
  • 中国AI大模型公司(DeepSeek、字节、阿里)重新将模型总参数规模作为核心竞争指标,向5万亿-10万亿参数级别推进,但此轮竞赛的核心驱动和架构基础已与上一轮不同。
  • DeepSeek条件变化(完成大额外部融资、筹备IPO、引进CFO)使其有能力在原有效率路线之上,开始大规模堆参数,两者并不矛盾。
  1. 01DeepSeek计划将后续模型拓展至8万亿参数,约为其V4-Pro(1.6万亿总参数)的5倍。字节跳动正在预训练一个最高可能达到10万亿参数的新模型。
  2. 02月之暗面Kimi K3是目前已发布的最大开放权重模型,总参数达2.8万亿,采用MoE架构,每个Token激活约3.7%的参数。
  3. 03阿里CEO吴泳铭公开表示下一代模型目标为5万亿到10万亿参数。
  4. 04DeepSeek 6月完成首轮约74亿美元外部融资,后续约75亿美元融资已进入敲定阶段,并启动科创板IPO筹备。
  5. 05MoE架构使总参数与计算量解耦,例如DeepSeek V4-Pro总参数1.6T但每次只激活490亿参数(约3%),使得模型容量可以继续扩张而每次推理成本不线性增长。
  6. 06Agent应用的长任务特性(可能持续数小时、涉及多步操作)产生“木桶效应”,要求模型具备全面的能力覆盖和稳定性,更大的参数容量恰好能满足这一需求。
反方 / 局限
  • 文章虽强调了超大参数在MoE下的优势,但未充分讨论大规模MoE在工程部署、维护众多专家路由的复杂性,以及其相对于小模型在特定垂直场景下的成本或延迟劣势。
  • 文章论点高度依赖于“Agent时代必然到来”这一前提。如果Agent应用未如预期普及,或端侧小模型能解决多数长尾需求,推高总参数规模的投资回报率将面临质疑。
9 分钟 · 5 卡片 · 13 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问