7.1
深览指数
科技人人都是产品经理·溪居即事··AI 生成
从炼丹、抽卡到一次成片,AI 视觉生成只用了四年
本文以作者亲历视角,梳理了从Stable Diffusion、ComfyUI、Midjourney到GPT图像生成、Seedance 2.0等AI视觉工具的演进路径。核心观点是:创作门槛从“伺候模型”(调参、部署、抽卡)转移到了“判断需求”(明确创意意图),提示词从技术咒语回归为自然的需求表达。文章指出,当前模型虽能“一次成片”处理常规任务,但在复杂场景下仍需人工修正,但修正重心已从调参转向调整创意。适合从2019年至今经历AI创作工具迭代的从业者、产品经理与内容创作者阅读,以校准对“AI创作能力”的认知焦点。原文 ↗
核心观点
- ▍AI视觉生成工具的核心演进方向,并非单纯提升画质,而是将创作者的重心从“如何让模型工作”转向“如何明确创意意图”,提示词从技术咒语回归为自然的需求表达。
- 01Stable Diffusion时代,用户需先攻克显卡门槛(显存、分辨率)、掌握checkpoint、LoRA、sampler、steps、CFG、seed等参数,且正向提示词需包含画质词、镜头词、艺术家名字,负向提示词需写bad hands以防止畸形。
- 02ComfyUI通过节点式工作台(加载模型、文本编码、采样、VAE解码、保存图片)给予用户精细控制,但代价是用户需像工程师一样搭建流水线,一个模型路径错误或缺失自定义节点即导致工作流报错。
- 03Midjourney降低了本地部署门槛,但“抽卡”模式仍存:用户需反复reroll、做变体,需求越具体,与工具的拉扯越明显,它擅长给出“好看”的图,但离“就是我要的那张”尚有距离。
- 04GPT将图像生成嵌入聊天框,支持多轮对话式修改(如“人物和衣服别动,背景换成晚上”),用户无需再手动指定采样器、CFG等参数,修正焦点从调参转向判断需求是否清晰。
- 052026年,字节Seedance 2.0和阿里HappyHorse将这一趋势扩展至视频,支持同时接收文字、图片、音频、视频作为输入,模型可解读包含人物、场景、分镜、对白、声音的完整创作Brief。
反方 / 局限
- — 当前模型在复杂排版、多人物一致性、精确动作、长视频叙事上仍会翻车,作者承认“一次成片”仅适用于常规配图和概念图,复杂任务仍需人工修正。
- — 文章隐含的前提是“创作者有明确的创意意图”,但现实中大量用户可能连“自己想要什么”都说不清——此时工具越简单,反而可能放大“创意空白”的焦虑。
7 分钟 · 5 卡片 · 11 资料
读原文 →