6.1
深览指数
科技量子位··AI 生成
全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型
Vivix 发布了首个实时交互多模态模型 A1,宣称其核心创新在于统一流式架构,将多模态参考、实时交互和流式生成整合进单一模型,而非传统数字人的流水线方案。A1 拥有近 30B 激活参数,通过 MJD 蒸馏、原生 NVFP4 训推协同和自研推理基础设施 VMI,声称能在消费级 GPU 上实现实时推理,单卡吞吐超 10000 video tokens/s,交互延迟平均 0.6 秒。文章详细拆解了 A1 在角色一致性、持续聆听、动作建模和效率优化上的技术路径,并提及同步发布的 W1 模型用于控制剧情走向。该文是面向技术社区的深度产品发布稿,信息密度高,但缺乏独立第三方验证和反方观点,适合对 AI 视频生成底层技术感兴趣的读者阅读。原文 ↗
核心观点
- ▍Vivix A1 是全球首个在统一原生流式架构中整合多模态参考、实时交互和流式生成的基础模型,区别于传统数字人采用的 ASR-LLM-TTS 流水线方案。
- ▍A1 的核心突破在于让屏幕里的虚拟角色拥有“身体”,能够持续行动、转身、改变姿态并与环境互动,而非仅对着镜头说话,这建立在长期一致性、持续聆听和实时生成之上。
- 01A1 拥有近 30B 激活参数,采用 8x8x4 的 VAE 压缩率,每秒 token 吞吐量需达到同类工作的数十倍。
- 02通过 MJD(多维联合蒸馏)技术,A1 将视频扩散从 8-Step 质量基线压缩到 2-Step 推理,同时保持接近 8-Step 版本的短时画质、指令遵循和长时稳定性。
- 03VMI 推理基础设施实现了 Encoder 与 Decoder 解耦、原生 NVFP4 训推协同,以及计算-通信-内存协同调度,单卡吞吐超过 10000 video tokens/s,PCIe 带宽利用率达 88%+。
- 04A1 的流式调度器响应新输入的最短时间为 300 毫秒,用户发出输入到画面首次出现可见反应的平均延迟为 0.6 秒。
- 05A1 直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号,而非仅依赖 ASR 文本作为唯一的交互中间表示。
- 06A1 通过因果时序建模和流式状态维护,利用局部连续性先验和全局序列先验,维持角色身份、场景和物体关系的长期一致性,防止视觉漂移和误差累积。
反方 / 局限
- — 文章未提及任何独立第三方评测或基准测试结果,所有性能数据(如延迟、吞吐量)均来自 Vivix 官方声明,缺乏外部验证。
- — 文章未讨论 A1 在复杂场景、长时间交互(如 30 分钟以上)中可能出现的角色一致性退化、幻觉或错误率,也未提及在照明、遮挡等极端条件下的鲁棒性。
- — 文章未与市场上其他近似实时推理的视频生成模型(如 1-5B 参数的小模型)进行直接对比,也未说明在消费级 GPU(如 RTX 4090)上运行的具体显存占用和帧率。
13 分钟 · 4 卡片 · 9 资料
读原文 →