7.7
深览指数
科技微博·机器之心Pro··AI 生成
视觉理解和生成能否相互促进?从视觉表征、任务到系统重新审视UMM
这篇论文系统性研究了在多模态统一模型(UMM)中,视觉理解与图像生成任务之间是否真正存在协同效应。研究发现,在表征层面两者能互相提供学习信号,但强制共享计算路径会导致冲突;在任务层面,当依赖相同底层知识时(如几何推理、SVG、3D空间智能),两者可实现双向提升。论文还证明,在需要理解、推理与生成紧密耦合的复杂任务中,端到端统一模型的性能优于模块化串联系统。该工作为UMM的设计提供了从表征到系统的分层理论框架和实验证据。原文 ↗
核心观点
- ▍视觉理解与生成在统一模型中存在双向正向迁移的潜力,但这种协同需要在架构层面解决表征冲突,且依赖于任务共享的底层知识。
- ▍端到端统一模型之所以有价值,在于理解和生成紧密耦合场景下的端到端优化本身是能力来源,而不仅仅是部署方便。
- 01在Dense Sharing架构中,联合训练提升了理解表征(ImageNet分类、ADE20K分割、NYUv2深度估计),但生成性能下降。
- 02使用modality-decoupled MoT架构后,结果反转:生成能力提升,理解能力下降。
- 03Task-decoupled MoT架构(理解与生成视觉token走不同分支但仍通过文本语义与共享注意力连接)避免了前述双向退化问题。
- 04几何推理任务中,加入几何图像生成与编辑任务后,不仅几何任务(Geometry3K、PGPS9K)提升,还泛化到MathVerse、MathVista等更一般的数学推理基准。
- 05控制实验表明,将相同生成数据转化为图像描述等理解任务并不能带来同等提升,说明生成任务提供了不同于语言描述的独特监督信号。
- 06SVG任务双向训练后,Image→SVG从80.64提升到81.70,SVG→Image从80.21提升到86.52,模型直接从SVG code想象icon的能力大幅提升。
- 073D空间智能相关理解与生成任务的联合训练也在多个基准上获得双向提升。
- 08在reasoning-intensive image editing任务上,端到端UMM在RISEBench和KRIS-Bench上全面优于模块化的Planner→Executor系统。
反方 / 局限
- — 论文主要在受控实验环境下验证了协同效应,但在真实大规模多模态预训练中,这种协同是否会被更大规模数据、更大模型容量或更复杂的训练目标所稀释或改变,尚需进一步验证。
- — 论文明确指出了表征冲突问题:当两种任务强制共享同一计算路径时,一个目标容易主导,另一个退化为辅助监督。这意味着UMM的架构设计需要高度精细化,并非简单的功能合并就能奏效。
统一多模态模型(UMM)MMLab@南洋理工大学Visual Understanding and Generation SynergyTask-decoupled MoTGeometry3KPGPS9KMathVerseMathVistaRISEBenchKRIS-BenchSVG3D空间智能
7 分钟 · 4 卡片 · 10 资料
读原文 →