科技量子位·思邈··AI 生成
国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源
兔展智能联合北大、鹏城实验室研发的UniWorld-View模型登顶李飞飞团队WorldScore榜单。该模型在单图/单目视频的新视角合成任务中,通过“遮挡感知点云渲染”和“双流条件注入”架构解决了大基线视角下的几何穿帮问题,并实现了从单目视频到4D场景的生成管线。全文技术细节清晰,但作为产品宣发稿,缺乏对自身局限或同类方案的对比,信息价值集中在技术方法层面。适合关注视觉生成前沿技术、尤其是3D/4D重建的从业者阅读。原文 ↗原文 ↗
核心观点
- ▍UniWorld-View通过“遮挡感知点云渲染”和“双流条件注入”架构,解决了大基线新视角合成中几何穿帮与外观不一致的核心矛盾,并实现了单目视频到4D场景的端到端生成。
- 01模型登顶李飞飞团队WorldScore榜单,为国产模型首次。
- 02提出“遮挡感知点云渲染”,包含双重投影和法向过滤两步,分别解决前景背景撕裂和背面漏光问题。
- 03采用“双流条件注入”:几何流使用点云渲染图+mask固定3D结构;外观流通过Ref-DiT模块,让模型从源视频中检索纹理填充区域。
- 04通过“先拍定妆照再拍动态”的两步法,解耦空间变换与时间推进,将单目视频转化为多视角视频,进而用于4DGS重建。
- 05模型已适配国产昇腾算力,代码和权重全部开源。
- 06研发团队兔展智能此前发布过Open-Sora Plan(2024年全球引用量第一的开源文生视频模型)和UniWorld-V2架构(早于NanoBanana)。
概念锚点
前置背景
平行视角
未来推演