7.2
深览指数
科技微博·晚点LatePost··AI 生成

生数科技张金涛:实时生成视频的想象空间有多大

生数科技发布了第二代实时生成视频模型S2,包含数字人Avatar和实时编辑Editing两大能力,可在720P画质下维持25-40帧/秒的实时交互。张金涛认为“使用即消费”的实时视频需求量将“最终超越语言模型”,但其核心判断基于对2C陪伴场景的乐观假设和对“实时交互”与“快速生成”的严格区分。文章提供了具体技术路径(Refiner、Self-Replay Forcing)、成本模型与竞争门槛判断,适合关注AI视频落地、多模态交互商业化的从业者阅读。原文 ↗

核心观点
  • ▍实时生成视频的最终需求量将“最终超越语言模型”,因为它满足每个人日常的实时视觉交互需求,而非局限于创作者群体。
  • ▍实时视频是“使用即消费”——每个用户拥有独立会话,直接与模型交互并消费内容,其商业逻辑与离线视频生成(创作工具)有本质区别。
  1. 01S2包含两个模型:S2-Avatar提升数字人真实感、指令跟随并支持实时参考生成;S2-Editing可实时修改输入视频流(来自摄像头、游戏等),支持换装、换背景、换风格。
  2. 02S2在720P分辨率下仍能维持每秒25-40帧的实时生成速度,速度是硬约束(生成0.1秒视频用时需<0.1秒),成本则越低越好。
  3. 03画质提升主要通过“Refiner”架构实现:一个基础实时模型负责结构/低频信息,一个一步扩散 Refiner 补充分辨率与细节;同时优化了推理算子与调度。
  4. 04张金涛认为视频生成中数据比模型大小更重要:Diffusion模型可被理解为“渲染器”,核心是训练数据质量(图片/视频质量、标注准确详细)而非参数量。
  5. 05生数S系列与Q系列(基础模型)在技术路线上相对独立:Q系列的数据储备和训练基础设施可复用,但具体模型效果因实时性的成本与速度约束很难直接迁移。
  6. 06S系列团队从2025年3月启动,由3人发展至约30-40人;张金涛此前是注意力加速算子SageAttention和视频加速框架TurboDiffusion的作者。
  7. 07生数计划推出ToC的陪伴/社交产品以建立数据闭环与竞争壁垒;同时对外提供API服务,但认为通过B端获取用户数据不够直接。
反方 / 局限
  • — 张金涛承认:大厂有扎实的数据和训练基础,“认真做,几个月就能追到不错的水平”;生数目前的先发优势主要来自时间和对方向的认知,并非不可撼动的技术护城河。
  • — 当前实时视频画质张金涛自评仅达到离线视频模型“约百分之五六十”,还有较大差距。
  • — 情感陪伴方向已有众多竞品,除了视觉形象逼真,用户对“有灵魂”“有同理心”的需求并非实时视频模型能直接解决,更依赖产品能力与背后的Agent系统。
19 分钟 · 4 卡片 · 8 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问