6.7
深览指数
科技微博·量子位··AI 生成

国产世界模型登顶李飞飞团队榜单!适配昇腾算力、代码权重全开源

UniWorld-View 模型在 WorldScore 榜单超越 ViewCrafter、GEN3C 等方案登顶,核心创新在于解决大基线新视角合成中点云渲染的「前景背景撕裂」和「背面漏光」两大工程难题,并提出双流条件注入架构。文章详细披露了模型技术细节,但本质是产品发布与技术解读,缺乏对自身局限或竞品优劣的深入讨论。适合关注计算机视觉、3D 生成、国产 AI 算力生态的技术从业者阅读。原文 ↗

核心观点
  • UniWorld-View 通过「遮挡感知点云渲染」和「双流条件注入」两大技术创新,解决了大基线新视角合成中常见的几何与纹理断裂问题,从而在 WorldScore 榜单上超越了 ViewCrafter、GEN3C 等现有方案。
  1. 01模型同时支持单图新视角合成和视频 4D 生成,采用「同一套代码、同一个模型」。
  2. 02「遮挡感知点云渲染」包含双重投影和法向过滤两招:双重投影将无法回投的像素标记为遮挡区域,法向过滤剔除背对相机的点,以清除条件图中的错误几何信号。
  3. 03「双流条件注入」架构使用几何流(点云渲染图+mask 编码)固定 3D 结构,外观流(Ref-DiT 模块的 cross-attention)从源视频补充纹理细节。
  4. 04模型已适配国产昇腾算力,代码和权重已在 GitHub 开源,训练数据来自北大系初创企业元空智能。
  5. 05模型可实现 4D 重建,通过「先冻结时间生成多视角静态锚点,再在固定机位上生成同步多视角视频」的两步方案,解耦空间与时间变换,最终喂给 4DGS 优化得到 4D 场景。
  6. 06研发团队兔展智能由北京大学校友与北大视觉领域青年人才联合创立,曾发布国内首个开源文生视频模型 Open-Sora Plan。
反方 / 局限
  • 文章未提及模型在极端复杂场景(如密集遮挡、高速运动、透明或反光物体)下的表现,也未与 ViewCrafter、GEN3C 等竞品进行定量对比,其优势的边界条件不明确。
  • 作为产品发布与技术解读文,本文对模型的理论框架创新性着墨较少,更像是工程优化与工程组合的胜利,理论贡献有待同行评议。
6 分钟 · 3 卡片 · 9 资料
读原文 →

前置背景

平行视角

延伸追问