5.4
深览指数
产品智东西·程 茜··AI 生成

Qwen-Image 3.0成全能打工仔!一键搞定专业图文物料,还能直出神图

阿里千问发布第三代图像生成模型Qwen-Image-3.0,核心突破在于精准的文字渲染能力,支持4.5k token超长文本输入、10px小字清晰显示及12种语言。文章通过大量实测案例(演唱会门票、20格漫画、《滕王阁序》全文生成、UI界面等)展示了模型在复杂图文排版、多格叙事一致性上的商用潜力。作者认为该模型已接近专业内容生产工具,但未提及推理成本、生成速度等关键生产指标,不适合对工程细节有严格要求的读者。原文 ↗

核心观点
  • Qwen-Image-3.0的核心亮点是突破文字渲染难题,使AI图像生成从个人创意工具转向专业内容生产底座。
  1. 01模型支持最大4.5k token输入,能精准生成报纸、分镜、试卷等含海量文字的复杂版面。
  2. 02实现了10px小字的清晰渲染,能逼真还原毛孔与发丝等微观质感。
  3. 03原生支持12种语言渲染,并具备丰富的世界知识,可构建网页、游戏及直播界面仿真。
  4. 04在文生图机器评测中,Qwen-Image-3.0是GPT Image 2之下国内排名第一的模型。
  5. 05实测案例包括:生成含多语种歌词的演唱会氛围图、20格分镜条漫、全文近800字的《滕王阁序》、多层UI嵌套(VS Code→千问App→微信)。
  6. 06模型在20人群像图、企业办公软件工作台布局、叶绿体光合作用原理结构图等复杂视觉场景中表现良好。
反方 / 局限
  • 生成20人群像图时,存在前景人物伞过大、手部与勺位置偏移等细节短板。
  • 20格条漫中有一个分镜的小猫比例不符合常理,蜷缩在了一只手里。
  • 文章全篇为产品功能演示与结果展示,未透露模型架构、训练数据、推理成本、生成速度等关键工程指标,缺乏对商业落地可行性的实质性分析。
14 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问