7.8
深览指数
科技腾讯新闻·翎听theSignal··AI 生成

实时生成模型今年是元年,但GPT时刻两年就会出现|翎听 x 生数张金涛

生数科技00后模型负责人张金涛认为,实时视频生成正从一种内容生产工具,转变为一种持续存在于现场的交互媒介,其市场潜力将超越离线视频生成,规模最终可能比肩甚至超过语言模型。文章核心观点是,实时视频的技术门槛首先是‘跟得上’播放速度,而非单纯画质;其次,成本必须降到消费级GPU可用,使普通用户支付得起。张金涛预测,该领域将在两年左右达到类似GPT-3.5的爆发点。文章也直面了平台掌握流量入口对模型公司的威胁,以及安全可控、算力优化等现实挑战。适合关注AI前沿技术、视频生成赛道、以及人机交互范式的从业者和投资人阅读。原文 ↗

核心观点
  • ▍实时视频生成的核心不是生成速度,而是“跟得上”播放速度的实时交互能力,它代表了一种全新的交互媒介,而非仅仅是内容生产工具的升级。
  • ▍实时视频的终极市场(实时交互的多模态娱乐)规模可能比肩或超过语言模型,因为它对应每个人独立的、持续的视觉交互需求,而离线视频生成的市场受限于内容复用逻辑。
  1. 01字节跳动通过种子团队的 SeedRealtime 和 Seedance 系列分别从实时音视频交互和离线视频生成两个方向切入。
  2. 02生数科技在2025年7月发布 Vidu S2,实现了视频流的实时编辑(换人、换装、换背景),且可在消费级 GPU 上运行。
  3. 03生数通过 SageAttention 低比特加速技术,在视频模型中实现了端到端两倍以上的加速。
  4. 04张金涛明确预测,未来两年左右实时视频行业会达到类似 GPT-3.5 的爆发点。
  5. 05张金涛认为中国在实时视频领域有数据优势,因为短视频和直播提供了海量原始训练数据。
反方 / 局限
  • — 作者承认平台掌握流量入口对模型公司是明显威胁,但目前的对策(只做API供应商或自建入口)并不独特。
  • — 作者指出,若模型发布后停止迭代,半年内竞争对手就会追上来,暗示技术壁垒和窗口期非常短暂。
  • — 文章未展开讨论实时视频生成中“模型主动判断”导致的安全和内容控制难题,仅提及需要“技术能力和安全能力同时往前走”,缺乏具体方案。
13 分钟 · 5 卡片 · 14 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问