7.3
深览指数
科技人人都是产品经理·Z Finance··AI 生成
ZPedia|视频正在从文件变成界面,Vidu S2 把 AI 视频推向实时交互
本文以生数科技 Vidu S2 为切入点,论证了 AI 视频正从'一次性生成内容'转向'持续交互的实时系统'。作者指出,离线视频生成(如 Sora)本质仍是'生产-交付'的单向流程,而 Vidu S2 通过双阶段架构、动态条件注入和 VLM Agent 等技术,实现了在视频运行中实时修改画面(换装、换背景、替换角色)。文章梳理了 HeyGen、Synthesia、Runway 等竞品的商业验证,并推测实时视频的商业模式将从'按条收费'转向'按会话时长和 API 调用结算'。适合关注 AI 视频技术路线、产品设计与商业化的从业者阅读。原文 ↗
核心观点
- ▍视频正在从一种一次性生成的'内容文件',转变为一种能够在运行中被持续输入、编辑和交互的'实时界面'。
- ▍Vidu S2 代表了这条路线的一次产品化落地:通过 S2-Avatar(实时互动)和 S2-Editing(实时编辑)双模架构,'实时生成'与'实时可改'首次在产品层面被整合。
- 01Vidu S2 采用双阶段架构:主干网络(Backbone)在低分辨率下处理结构与语义,精炼网络(Refiner)异步生成纹理细节,两条流水线并发以兼顾实时性与画质。
- 02系统重新设计位置编码,允许新参考图(商品图、服装等)在 Session 中动态加入,且只影响后续帧,不干扰已生成内容。
- 03引入轻量化 VLM Agent 持续判断动作进度,在上一个动作执行完毕后再发出下一条指令,以减少动作抢跑与肢体穿模。
- 04S2 通过强化学习对少步因果模型进行部署端优化,以提升指令遵循能力和画面质量。
- 05商业对标:HeyGen 于 2026 年披露 ARR 超 2 亿美元,Synthesia 于 2025 年 ARR 超 1 亿美元,两家公司均验证了企业为实时视频交互付费的意愿。
- 06资本密集下注:Synthesia 2026 年初获 2 亿美元 E 轮融资(估值 40 亿美元),Runway 获 3.15 亿美元融资(估值 53 亿美元),资金明确投向实时流式视频与世界模型。
- 07Vidu S2 还尝试了实时空间视频生成(同步左右眼视图流式传输至 VR 头显),字节跳动亦被曝布局该方向,空间视频正成为实时视频的新分支。
反方 / 局限
- — 作者承认实时视频当前仍受制于推理成本、并发能力和系统稳定性,'从 Demo 走向规模化部署'还需持续降低单小时推流成本并提升一致性与可用时长。
- — 文中指出,实时视频的商业模式从'按条收费'转向'按会话时长与并发路数结算',意味着利润空间直接被算力成本与系统稳定性锁定,工程取舍会明显影响盈利能力。
13 分钟 · 3 卡片 · 5 资料
读原文 →