7.0
深览指数
科技人人都是产品经理·Z Finance··AI 生成

腾讯混元多模态迎来新负责人,OpenAI田永龙将加盟

腾讯混元多模态团队从OpenAI引入研究科学家田永龙,他将成为多模态方向负责人,向去年加入腾讯的姚顺雨汇报。田永龙在学术上与MIT的Phillip Isola、港中文的汤晓鸥等知名学者有渊源,是Supervised Contrastive Learning和自回归图像生成模型Fluid的核心作者。文章梳理了其从清华到MIT、从DeepMind到OpenAI的履历,并指出腾讯混元在多模态能力上落后于字节豆包和阿里通义,这轮引援意在补齐基础研究短板。适合关注AI产业人才竞争、大模型多模态技术路线(对比学习vs自回归vs扩散模型)的读者阅读。原文 ↗

核心观点
  • 腾讯混元在多模态能力上落后于字节豆包和阿里通义,引入田永龙是为了在基础研究层面补课,以建立真正的技术壁垒。
  1. 01据雷锋网报道,田永龙将成为混元多模态模型方向的负责人,并向已在腾讯的姚顺雨汇报,但尚未正式入职。
  2. 02田永龙的学术背景包括清华大学本科、港中文MMLab师从汤晓鸥和王晓刚、MIT师从Phillip Isola读博,博士毕业后先后在Google DeepMind和OpenAI工作。
  3. 03田永龙的Google Scholar引用数达28,778次,h-index 35,2026年就有3,436次引用。
  4. 04田永龙是Supervised Contrastive Learning(有监督对比学习)的第一作者,该工作影响了SimCLR、MoCo等系列后续视觉预训练模型。
  5. 052024年10月发表的Fluid模型提出连续token和随机生成顺序可显著提升自回归图像生成质量,训练了10.5B参数模型。
  6. 06田永龙还参与了Autoregressive Image Generation without Vector Quantization(与何恺明合作)等研究,探索视觉生成、理解与表征学习的统一框架。
  7. 07腾讯混元多模态团队近一年经历剧烈组织震荡:原负责人刘威离职创业,2025年4月TEG成立独立多模态模型部,后引入胡瀚、薄列峰、庞天宇等人。
  8. 08接近腾讯的人士表示,字节豆包在多模态和内容创作生态上最强,阿里通义在长文本和办公场景更专业,混元虽深度绑定微信/QQ生态但技术领先性有差距。
反方 / 局限
  • 文章未提及田永龙在OpenAI期间的具体量化产出(如主导了GPT-4o多模态的哪个模块、贡献度如何),也未分析其学术成果转化为工业级多模态模型的实际难度与风险。
8 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

未来推演