7.8
深览指数
科技腾讯新闻·晚点LatePost··AI 生成

字节讨论训超5万亿参数模型,张一鸣:不蒸馏、别被短期热点影响

《晚点 LatePost》独家披露,字节跳动正讨论训练参数规模超 5 万亿的语言模型,试图以此弯道超车,追赶在 Coding 等能力上领先的智谱、月之暗面等对手。文章详细呈现了张一鸣在 Seed 全员会上的表态:反对蒸馏,鼓励做有自身特色的模型,可接受短期落后以追求智能上限。同时揭示了 Seed 内部的组织反思、多模态模型领先但语言模型追赶的现状,以及火山引擎商业化增速放缓的具体数据。此文适合关注中国大模型竞争格局、字节战略决策及 AGI 技术路线的读者。原文 ↗

核心观点
  • 字节跳动正讨论训练参数规模超 5 万亿的语言模型,试图通过大幅提升参数规模,在语言模型领域实现弯道超车,以追赶在 Coding 能力上领先的对手。
  • 张一鸣在 Seed 全员会上明确反对模型蒸馏,认为这本质是复制已有能力,无法实现超越,并鼓励团队聚焦更底层的 AGI 壁垒构建。
  1. 01字节计划训练的模型参数超过 5 万亿,是国内已知规模最大的,超过阿里的 Qwen 3.8-Max(2.4 万亿)和月之暗面的 K3(2.8 万亿)。
  2. 02Seed 的模型能力落后影响商业化:火山引擎 2025 年收入约 150 亿元,2026 年目标超 400 亿元;但豆包大模型 token 消耗中,超过一半来自多模态模型 Seedance 和 Seedream。
  3. 03豆包大模型 token 消耗增长不及预期,3 月为 120 万亿,6 月为 180 万亿,低于原计划的 250 万亿至 300 万亿目标,主因是短剧行业增长见顶及经济环境变化。
  4. 04张一鸣亲自邀请并高薪吸引 DeepSeek 核心研究员郭达雅加入 Seed,负责模型 Coding 能力专项训练,并整合相关研发资源。
  5. 05Seedance 的成功模式(将预训练做到极致)被字节视为路径验证:成为首个完整采用 MoE 架构的视频生成模型,参数达 2000 亿,被公认为全球最强视频模型。
  6. 06为集中资源,字节高层在 Seed 内部推动取消赛马机制,收拢同一方向资源,并尝试打破部门墙。
反方 / 局限
  • 一位接近 Seed 人士将训练超大规模模型比喻为“一场赌博”,暗示其高投入、高不确定性的风险。
  • 文章指出,虽然视频模型 Seedance 成功,但更大参数的语言模型面临完全不同量级的系统工程、数据处理和部门协作挑战,难度远超前者。
8 分钟 · 4 卡片 · 8 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问