6.5
深览指数
科技量子位·思邈··AI 生成

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

兔展智能联合北大、鹏城实验室研发的UniWorld-View模型登顶李飞飞团队WorldScore榜单。该模型在单图/单目视频的新视角合成任务中,通过“遮挡感知点云渲染”和“双流条件注入”架构解决了大基线视角下的几何穿帮问题,并实现了从单目视频到4D场景的生成管线。全文技术细节清晰,但作为产品宣发稿,缺乏对自身局限或同类方案的对比,信息价值集中在技术方法层面。适合关注视觉生成前沿技术、尤其是3D/4D重建的从业者阅读。原文 ↗

核心观点
  • UniWorld-View通过“遮挡感知点云渲染”和“双流条件注入”架构,解决了大基线新视角合成中几何穿帮与外观不一致的核心矛盾,并实现了单目视频到4D场景的端到端生成。
  1. 01模型登顶李飞飞团队WorldScore榜单,为国产模型首次。
  2. 02提出“遮挡感知点云渲染”,包含双重投影和法向过滤两步,分别解决前景背景撕裂和背面漏光问题。
  3. 03采用“双流条件注入”:几何流使用点云渲染图+mask固定3D结构;外观流通过Ref-DiT模块,让模型从源视频中检索纹理填充区域。
  4. 04通过“先拍定妆照再拍动态”的两步法,解耦空间变换与时间推进,将单目视频转化为多视角视频,进而用于4DGS重建。
  5. 05模型已适配国产昇腾算力,代码和权重全部开源。
  6. 06研发团队兔展智能此前发布过Open-Sora Plan(2024年全球引用量第一的开源文生视频模型)和UniWorld-V2架构(早于NanoBanana)。
7 分钟 · 4 卡片 · 7 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演