4.4
深览指数
科技智东西·杨 京丽··AI 生成

手绘图直接变海报,国产开源多模态模型把图片玩“活”了

商汤发布轻量级开源多模态模型 SenseNova U1.5-Lite-Preview,参数量仅 8B,但在 4K 图像生成、复杂提示词遵循、参考图创作和图像编辑上表现突出。文章通过多个案例展示了模型从手绘草图生成海报、根据参考图风格迁移、多素材组合、以及精准修改文字/元素等能力。评测分数在图像编辑等任务上超过部分大参数开源及闭源模型。适合对多模态模型技术进展、AIGC 工具落地感兴趣的技术从业者快速了解产品现状。原文 ↗

核心观点
  • 商汤推出的 SenseNova U1.5-Lite-Preview 以 8B 参数量实现了多模态统一架构下的高质量图像生成与编辑,在特定评测项上超过部分大参数模型。
  1. 01模型在 Qwen-Image-Bench 评测得分从 U1 的 47.14 分跃升至 55.20 分。
  2. 02GEdit-Bench 测试中,英文项 8.17 分、中文项 8.05 分,均超过部分大参数开源及闭源模型。
  3. 03模型可以将手绘草图(如潜水装备流程图)生成为包含图示、图标、文字的商业风格海报。
  4. 04在复杂提示词任务中,模型生成了包含 24 个节气、按时间顺序排列、风格统一的长卷全景图。
  5. 05模型支持 4K 图像生成,在渔民整理渔网的案例中,渔网线结、船体锈迹等细节清晰,空间层次分明。
  6. 06模型可以基于单张参考图进行风格迁移(如可再生能源海报→古代香料贸易海报),并保留色彩、排版和质感。
  7. 07模型可提取多张人物参考图中的特征,将三个角色组合到同一场景中,保留发色、服装和配饰。
  8. 08在图像编辑方面,模型能精准修改海报中的文字(如将“VACKER”改为“MARKET”)而不影响其他区域。
  9. 09模型支持通过圈画指定区域进行多元素编辑(如添加黏土狮子、人偶、长颈鹿),保持添加元素与原图光影一致。
反方 / 局限
  • 文章未提及模型在复杂场景中(如多人脸、多物体交叠、极端光照)的编辑失败率或稳定性问题。
  • 文章未比较模型与同类竞品(如 DALL-E 3、Midjourney 等)在真实用户场景下的实际使用体验,评测仅覆盖特定任务。
12 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问