7.6
深览指数
科技微博·机器之心Pro··AI 生成

A²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

上海交通大学联合上海创智学院团队提出A²-Edit,一种统一框架,可支持任意物体类别和任意精度掩码(包括手绘或检测框)的参考图引导编辑。核心创新在于混合Transformer专家路由架构(对不同类别物体差异化建模)和掩码退火训练策略(逐步放宽掩码精度,摆脱精细分割依赖)。辅以50万级多品类数据集UniEdit-500K,在服装、人像、建筑等多品类上,相比现有方法取得了更优的量化指标和视觉效果。适合关注AIGC、图像编辑、计算机视觉前沿的研发人员或产品经理,了解当前技术天花板和下一步方向。原文 ↗

核心观点
  • A²-Edit 通过混合Transformer专家路由和掩码退火训练,在统一框架下同时解决了参考图编辑中跨类别物体建模能力不足和精细掩码依赖两大核心问题。
  1. 01混合Transformer专家路由架构将传统MoE从仅作用于FFN扩展至Attention与FFN联合建模,门控网络根据输入特征自适应选择专家分支,实现品类差异化建模。
  2. 02掩码退火训练策略(MATS)分三阶段:精细掩码训练 → 形态学膨胀和Perlin噪声模拟手绘误差 → 边界框训练,迫使模型从依赖几何边界转向上下文语义推理。
  3. 03团队自建UniEdit-500K数据集,包含50万余组图像对,覆盖服装、人像、动物、植物、家具、交通工具等八大类、209个细分类别。
  4. 04在VITON-HD、AnyInsertion和自建UniEdit测试集上,A²-Edit在DINO-I、CLIP-I、LPIPS、FID和VLM评分上均取得最优结果,且从精细掩码切换到粗掩码时指标基本无损。
  5. 0524位参与者的用户研究中,A²-Edit在与全部基线的两两比较里均获得更高偏好率。
反方 / 局限
  • 当前峰值显存约42GB,部署门槛高于多数消费级显卡,存在进一步轻量化空间。
  • 当用户给出的掩码范围过大且缺少明确文本提示时,仅凭参考图和粗定位可能出现多种合理解释。
6 分钟 · 4 卡片 · 8 资料
读原文 →

前置背景

应用场景

平行视角

延伸追问