5.5
深览指数
产品微博·量子位··AI 生成

这个新生图模型有点夯:4K直出的,国产的,开源的!

商汤开源了其轻量级统一多模态模型 SenseNova U1.5-Lite-Preview,核心亮点是能在 8B 参数规模下原生直出 4K 图像,并具备复杂的图像理解和编辑能力。文章通过大量案例展示了模型处理高信息密度内容、版式复刻、局部精准编辑(如改字、换氛围)等能力,并解释了其背后的 NEO-Unify 统一架构。本文是一篇典型的产品发布与技术能力展示,适合关注 AI 生图模型技术进展与开源生态的读者快速了解商汤的最新成果。原文 ↗

核心观点
  • 商汤推出并开源了 SenseNova U1.5-Lite-Preview 模型,其核心卖点是轻量级(8B参数)下实现原生4K图像直出,并具备强大的复杂指令理解和图像编辑能力,使其更接近真实的内容生产工具。
  1. 01模型采用自研NEO-Unify统一多模态架构,将语言、视觉语义和像素生成放在同一套模型里建模,实现了视觉理解、推理、生成与编辑的统一。
  2. 02展示了生成高信息密度“银盐摄影”信息图的能力,模型能同时处理时间线、知识模块、结构拆解和视觉层级。
  3. 03能够复刻输入图的“设计框架”(如手绘水彩风格路线图),并将其主题替换为“邮政邮件的旅程”,展示了版式与风格迁移能力。
  4. 04支持局部精准编辑,如将“迎”字改为“命”字,模型能理解原字由船和浪花构成,并重新组织笔画;也能根据marker指令将满月夜景改为血月夜景。
  5. 05支持多参考图输入,如将真实炸鸡照片与手绘食谱模板结合,生成可直接用于社交媒体的手绘风格食谱。
  6. 06在技术评测榜单上,相较于上一代U1,在Qwen-Image-Bench、ImgEdit-Bench、GEdit-Bench等多项指标上均有提升。
反方 / 局限
  • 文章承认U1.5-Lite-Preview仍是早期预览版本,在短Prompt理解、小字与人像细节、整体美学一致性以及复杂场景编辑的稳定程度方面仍有提升空间。
9 分钟 · 5 卡片 · 10 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问