图像生成
图像生成
图像生成(AIGC 绘画)是生成式 AI 中最先大规模商用的方向:从 Stable Diffusion 开源引爆社区,到 Midjourney、即梦、FLUX 等产品化,「输入一句话出图」已经成为设计、营销、电商的日常工具。但生成容易、可控难、商用更难——本文讲清楚生成模型谱系、扩散模型原理、主流生态、可控生成技术、质量评估与产品视角,帮助 AI 产品经理判断「什么场景能用、什么场景别硬上」。
读本文之前
本文以扩散模型为主线,建议先读 多模态理解 了解多模态的整体框架,再读本文;原理部分需要一点线性代数和概率直觉,但产品视角部分不依赖任何数学。
生成模型谱系
为什么生成图像难
图像是高维连续数据:一张 512×512 的 RGB 图像是 78 万个数值,可能的组合接近无穷。生成任务要求模型从训练数据学到的分布里采样出新样本,难点在于:
- 分布太高维:没法直接估计,只能靠神经网络隐式建模。
- 模式太多:训练数据里的图像风格、物体、构图千差万别,模型容易「只记住一部分」,导致生成多样性不足。
- 人眼对细节极其敏感:模糊、变形、假纹理、手指多一根,一眼可见。理解任务「读对」即可,生成任务必须「画对」,难度高出一个量级。
- 评价困难:生成结果没有唯一正确答案,「好不好」高度主观,导致模型训练与产品验收都缺少干净的标尺。
VAE:隐空间 + 重建
变分自编码器(VAE)的思路是:训练一个编码器把图像压缩成低维隐变量(latent),再训练一个解码器从隐变量重建图像。模型学的是「图像 → 隐空间 → 图像」的压缩重建,生成时从隐空间采样再解码。
- 价值:VAE 是扩散模型的基础设施——Stable Diffusion 的 VAE 负责把图像压到隐空间,让扩散过程在低维空间里进行,省一个数量级的算力。
- 局限:纯 VAE 直接生成,图像会偏模糊——重建损失(逐像素比对)天然偏好「平均长相」,细节被抹平。所以它很少单独当生成主力,更多是当「图像进出压缩通道」。
GAN:生成器与判别器对抗
生成对抗网络(GAN)让两个网络互相博弈:生成器负责把噪声变成图片,判别器负责分辨「真图还是假图」。生成器骗不过判别器就要继续改进,两者在对抗中共同变强。
- 优点:生成快(单次前向即可,不需要迭代)、细节锐利,曾统治图像生成与超分领域;StyleGAN 系至今仍是人脸生成与可控编辑的经典方案(风格分层控制:粗层管脸型、细层管皮肤纹理)。
- 致命缺点:
- 训练不稳定:判别器太强则生成器梯度消失(学不动),太弱则生成器偷懒(学到假的捷径);调 GAN 像走钢丝。
- 模式崩溃(mode collapse):生成器只学会生成少数几种「安全」的图,多样性塌陷——你反复生成,看到的都是同一张脸的变体。原因在于对抗博弈只有「赢」与「输」,没有「覆盖全部模式」的约束;缓解手段(惩罚多样性、小批量判别、谱归一化)都是打补丁,无法根治。
- 现状:2021-2023 年扩散模型全面取代 GAN 成为文生图主流;GAN 退守超分、实时生成(人脸美颜、视频帧插值)等对速度敏感的场景——「一步出图」的实时性是 GAN 至今不可替代的护城河。
扩散模型:后来居上
扩散模型(DDPM,2020)的思路完全相反:训练时给图像逐步加噪声直到变成纯噪声,再训练一个网络学会逐步去噪、从噪声里把图像还原出来。生成时从随机噪声出发,一步步去噪得到新图(DDPM 论文)。它为什么后来居上:
- 训练稳定:损失函数就是「预测噪声准不准」的回归目标,不像 GAN 要维持博弈平衡,也不像 VAE 那样容易模糊。
- 质量高:逐步去噪能精细重建细节,生成质量全面超过 GAN——这正是 2021-2022 年文生图质量跃迁(如 DALL-E 2、Stable Diffusion)的技术基础。
- 可控性强:去噪过程天然可以接受文本、结构图等条件输入,为后来的 ControlNet、LoRA 等可控生成生态埋下伏笔。
代价是推理慢(要迭代几十步去噪)与算力高,但工程上已用潜空间扩散、少步采样(DDIM、LCM 等)、蒸馏等方法大幅缓解,消费级显卡与手机端推理都已可行。
四条路线对比
| 路线 | 原理 | 优点 | 缺点 | 现状 |
|---|---|---|---|---|
| VAE | 压缩-重建 | 结构简单、是扩散的基建 | 生成偏模糊 | 作组件而非主力 |
| GAN | 生成器-判别器对抗 | 生成快、细节锐利 | 训练不稳定、模式崩溃 | 超分/实时场景 |
| 扩散 | 加噪-去噪 | 质量高、训练稳、可控 | 推理慢、算力高 | 文生图主流 |
| 自回归 | 逐 token 预测 | 复用 LLM 基建 | 高分辨率成本高 | 统一多模态方向之一 |
自回归与统一多模态的探索
还有一条「回到语言模型」的路线:用 VQ-GAN 类方法把图像离散化成 token,像 GPT 一样逐 token 预测图像。自回归生成的优势是架构与 LLM 完全统一(一套参数既能写文章也能画图),劣势是逐 token 生成高分辨率图太慢、且顺序生成难以建模复杂像素依赖。代表工作如 Janus、Chameleon、Transfusion 等(以论文与官方为准),它们指向的终局是「理解与生成一套参数」——与 多模态理解 里原生多模态的收敛方向一致。对产品经理的意义:未来可能一个 API 同时做看懂、改图、出图,现在则要在「质量最高的扩散模型」与「最统一的架构」之间按需选择。
扩散模型原理
前向与反向:加噪与去噪
- 前向过程:按一个噪声调度表,逐步向真实图像添加微小高斯噪声,经过 T 步(DDPM 论文中 T=1000)后图像近似变成纯随机噪声。这个过程的妙处是数学上可以一步到位:任意时刻 t 的带噪图像可以直接由原图加对应强度的噪声得到,训练时不需要真的迭代 1000 步。
- 反向过程:训练一个神经网络(如 U-Net 或 DiT)学习去噪——给定带噪图像和时间步 t,预测「这一步加进去的噪声是什么」。预测准了,生成时就能从纯噪声出发,一步步「减去噪声」还原出图像。
- DDPM 的直觉:整个模型学的其实就是预测噪声,而不是直接预测图像;用带噪图像减去预测噪声,就等价于向真实图像迈近一步。训练损失就是「预测噪声 vs 真实噪声」的均方误差,简单到近乎朴素,却非常有效。
- 训练与推理过程一览:训练时(1)取一张真实图,VAE 编码进隐空间;(2)随机采一个时间步 t,按调度加对应强度噪声;(3)U-Net/DiT 预测该步噪声,与真实噪声算均方误差更新参数。推理时(1)随机采一个纯噪声 latent;(2)从 t=T 到 t=1 循环「预测噪声 → 减去噪声」;(3)VAE 解码成像素图。同一个模型,训练和推理共享「预测噪声」这个核心技能。
噪声调度、采样器与加速
- 噪声调度(scheduler):「每步加多少噪声」随时间变化的曲线(线性、余弦等),决定训练质量;调度与采样器要配套,「错配」会导致生成质量下降甚至发散。
- 采样器(sampler):同样的模型,用不同采样器(DDIM、DPM++、Euler、LCM 等)出图风格与细节不同;采样器决定了「用几步、怎么走」,是调参老手与新手拉开差距的地方。
- 少步采样与蒸馏:LCM(潜在一致性模型)与蒸馏路线把几十步压到几步甚至一步,换来实时生成,代价是质量与多样性略降——「秒出图」与「分钟级精修」其实是两个价位、两种产品形态。
加速采样:DDIM 与采样器
DDPM 原版要跑 1000 步才能生成一张图。DDIM 的核心洞察是:去噪路径不唯一——可以设计一条「确定性」的短路径,用几十步甚至十几步就完成生成,质量损失可控。这开启了采样器(sampler)的生态:不同的采样器(DDIM、DPM++、Euler 等)在步数、速度、细节偏好上有差异,是「同样的模型,不同工具链出图风格不同」的原因之一。工程上还有模型蒸馏与一致性模型(一步出图)路线,把生成压到实时,代价是质量与多样性。
潜空间扩散:LDM / Stable Diffusion
直接在像素空间做扩散太贵(每次去噪都要处理整张图),Latent Diffusion(LDM,2021)的方案是:先用 VAE 把图像压缩进低维隐空间,再在隐空间里做扩散去噪,最后用 VAE 解码器把隐向量还原成像素图(LDM 论文)。省掉的算力是数量级的——Stable Diffusion 能在消费级显卡上跑起来,根本原因就是「在压缩后的空间里工作」。Stable Diffusion 的完整管线是「CLIP 文本编码器(把提示词变成向量)+ VAE(图像进出隐空间)+ U-Net/DiT 去噪主干」三件套。
文本条件与无分类器引导
- 文本条件:提示词经 CLIP 文本编码器变成条件向量,在去噪每一步通过交叉注意力注入主干网络,让生成过程「听提示词指挥」。CLIP 的文本编码器最长约 77 个 token,长提示词会被截断——这是很多「提示词写长了没用」现象的技术根源;新模型(SDXL 双编码器、FLUX 用 T5/大 VLM)已大幅扩展文本理解长度与能力。
- 无分类器引导(Classifier-Free Guidance,CFG):训练时让模型同时学会「无条件去噪」和「有条件去噪」,生成时把两者的输出外推:
预测 = 有条件预测 + 引导系数 × (有条件预测 − 无条件预测)。引导系数(CFG scale)越大,图像越贴提示词,但过大就会过饱和、失真。它实际上就是提示词权重的实现机制——(word:1.2) 之类的语法就是局部放大条件与无条件之差。 - 负提示词:用「不要的东西」的文本嵌入参与引导,相当于把无条件预测换成「不要这个」的预测,从而把负面特征(模糊、畸变、多余物体)推远。
条件控制的统一框架
扩散模型的可控性来自「去噪过程能接受各种条件」这一个统一的机制——文本、参考图、结构图、蒙版,本质都是「引导去噪方向的额外输入」:
- 文本条件:交叉注意力注入,最常用的控制通道。
- 参考图条件:图生图(把输入图加噪声再重新去噪)、IP-Adapter(参考图编码成条件注入)、ControlNet(参考图先转成边缘/深度/姿态再注入)——同样是「给条件」,注入的层级与预处理不同,控制强度也不同。
- 蒙版条件:局部重绘(inpaint)只对蒙版区域去噪,其余保持;扩图(outpaint)在画布边缘之外生成新内容。
- 多条件叠加:现代框架(SDXL/FLUX 的 ControlNet、多参考图模型)支持多条件同时注入,「文本 + 姿态 + 风格图」一张图全控。
理解了「一切都是条件」,就能读懂工具里 80% 的参数——它们都是「条件有多强、从哪里进」的旋钮。
一句话解释给非技术同事
扩散模型就像一个「先打碎再复原」的画师:训练时它见过无数张图被一步步加噪打碎、再复原的过程,学会了「从噪点里猜出原图」;生成时你就给它一把纯噪点,它按你提示词的方向一步步把画面「复原」出来。提示词权重(CFG)就是「你要我多听话」的旋钮,拧太大画面会发烫发艳。
训练与性能优化
产品经理不需要训练模型,但要懂「为什么训练贵、推理慢」,以及团队讨论技术方案时能对上话:
- 训练成本结构:文生图底模训练 = 海量图文对数据(十亿级)+ 大规模 GPU 集群(数千卡 × 数周);微调(LoRA/ControlNet)只要数张到数百张图、单卡到数卡、小时到天级——「自己训底模」几乎不现实,「微调现成底模」是常态。
- 混合精度:FP16/BF16 训练与推理,显存与速度翻倍,是默认配置;量化(INT8/INT4)进一步压推理显存,但出图质量可能略降。
- 显存优化:VAE Tiling(分块解码大图)、TAESD(轻量 VAE)等技巧解决「大分辨率爆显存」;服务端用批量推理与缓存(相同提示词 + seed 命中缓存)摊薄成本。
- 推理加速:采样器优化、少步蒸馏、缓存中间层(DeepCache 类)、并行/批处理——「首图速度」是产品体验硬指标,和「图质量」要一起验收。
- 数据工程是隐藏成本:微调数据的清洗(去模糊、去重、修正标签)决定 LoRA/ControlNet 的上限——「数据脏,参数再对也白搭」;建议把数据管线(采集 → 清洗 → 打标 → 分桶)与模型训练同等对待,团队里要有人为数据负责。
超分与图像修复
生成模型之外,还有一组「低层视觉」能力常和文生图搭配使用,是电商与内容产品的常见配件:
- 超分(Super-Resolution):把低清图放大并补细节;GAN/扩散类超分模型(GigaGAN、AuraSR 等)比传统插值(双三次)质量高得多,但会把「猜的细节」画进去——证件照、商品图慎用,艺术图放心用。
- 去噪与修复:老照片去噪、划痕修复、上色,是情怀类产品与素材修复的刚需。
- 评价指标:PSNR/SSIM 衡量像素级保真,LPIPS 衡量感知相似度——超分产品「看得顺眼」比「像素接近」更重要,验收以人眼为准。
- 与文生图的组合:「生成 → 超分 → 精修」是标准流水线,ComfyUI 里一条工作流即可串起来。
- 产品注意:超分会「无中生有」地补细节——把低清人脸放大,可能补出一张不像本人的脸;人脸相关超分要配身份校验。
- 典型场景:电商大图精修、老照片修复、监控画质增强(注意证据类用途的合规与不可篡改要求)。
主流生态与工具链
开源权重生态
- Stable Diffusion 系列:SD 1.5(2022,512 分辨率、社区模型海量)→ SDXL(2023,1024 分辨率、双文本编码器)→ SD 3 / 3.5(2024,DiT 架构、16 通道 VAE、文字渲染大幅改善)。每代都带动一轮社区模型与插件生态爆发(Stability AI)。
- FLUX:Black Forest Labs 出品(核心成员来自 Stable Diffusion 原团队),FLUX.1 以更强的文本理解与手部/文字渲染著称;FLUX.2 系列进一步统一文生图与多参考图编辑,文本编码器从 CLIP+T5 换成大视觉语言模型,「指代理解」(说哪个物体就改哪个物体)能力显著提升(FLUX)。
- 国内开源:Z-Image、GLM-Image、Seedream(即梦底模)等陆续开源,中文场景与可控编辑各有亮点(以官方仓库为准)。
- 社区模型:基于开源底模微调的垂直模型(动漫、写实、建筑、产品图)数以万计,是开源生态最独特的资产——底模决定上限,社区模型决定垂直场景的下限;同一底模的社区衍生模型之间还能融合(模型融合是社区玩法的重头戏)。Civitai 等平台是模型分发与体验的主渠道,选模型看「下载量 + 示例图 + 训练说明」三件套,别只看封面。
开源 vs 闭源的取舍
- 开源:可控(参数、数据、部署全在自己手里)、可微调、单张边际成本低;代价是能力追赶闭源旗舰有代差、需要自建运维与安全审核。
- 闭源 API:能力最新、质量最稳、合规与审核往往内置;代价是数据出域、按张付费、对平台政策有依赖。
- 组合打法:核心资产用开源自部署(风格、角色、私有数据),前沿探索用闭源 API——两条腿走路是 2026 年多数团队的形态。
商用文生图 API 与产品
OpenAI images(GPT-Image,与 ChatGPT 同一套能力)、即梦(字节)、Midjourney(订阅制)、Ideogram、Recraft 等,能力与价格差异大,以各官方页面为准。商用 API 的典型卖点是:文字渲染正确、指代理解强、原生支持编辑(局部修改、扩图),而开源路线则胜在可控、可私有化、单次成本低。选型维度:文字渲染质量、中文支持、编辑能力、价格量级、内容安全与数据政策——把「你的业务用例集」跑一遍再定,不要只看演示图。
模型与路线选型对照
| 方案 | 适合谁 | 优势 | 代价 |
|---|---|---|---|
| SD 1.5 系 | 社区玩法、老插件生态 | 模型最多、显存要求低、教程最全 | 512 分辨率上限,文字渲染弱 |
| SDXL 系 | 个人创作、风格 LoRA 训练 | 1024 分辨率、风格生态成熟 | 对提示词质量敏感 |
| SD 3/3.5、FLUX 系 | 生产级、文字与指代要求高 | 文字渲染强、遵循度高 | 显存与推理成本高 |
| 商用 API | 快速上线、无运维团队 | 质量稳定、编辑能力内置 | 按张付费,数据出域 |
| 自部署 + 微调 | 量大、数据敏感、要垂直化 | 单张成本低、数据不出域 | GPU 与运维成本、版本跟进 |
「先 API 跑通业务、验证量级后再自部署」是最常见的路径——不要一上来就买卡。
工具链:WebUI 与 ComfyUI
- Stable Diffusion WebUI(A1111):面向个人用户的图形界面,装插件、下模型、调参数门槛低,适合快速上手与单图实验。
- ComfyUI:节点式工作流(拖拽连线拼出「文生图 → 局部重绘 → 超分」的完整流水线),可复现、可批量、可编程,是生产与自动化场景的事实标准。
- Diffusers:Hugging Face 的 Python 库,面向开发者集成进自己的产品。
- 工作流资产化:同一张图的参数组合(模型 + LoRA + ControlNet + 采样器 + 提示词)是可复用的工作流资产,团队应沉淀模板而不是每次从零调参;ComfyUI 工作流文件本身就是可分享、可版本管理的资产。
可控生成
文本提示词能描述「画什么」,但说不清「怎么布局」——「三个人站在左边,红裙子女士在前」这种指令,纯靠提示词很难稳定命中。可控生成技术解决的就是「把生成结果钉在结构上」:
| 技术 | 原理 | 典型用途 |
|---|---|---|
| ControlNet | 冻结底模,另训一条可训练分支,把条件图(姿态/深度/边缘/线稿)在去噪各层注入,零初始化保证不污染底模 | 按姿态出图、按深度重绘、线稿上色、版式控制 |
| LoRA | 低秩分解微调:冻结大模型,只训练两个小矩阵(如 r=8 时参数约缩 64 倍),把风格/角色/概念写进权重增量 | 风格一致(某画师风)、角色一致(虚拟模特)、垂直领域微调 |
| IP-Adapter | 参考图作为条件注入,不训练也能「照着这张图的感觉出图」 | 参考构图/配色/风格,角色一致性 |
| 图生图(img2img) | 输入图加噪声后按指定强度重新去噪,denoising strength 控制改多少 | 换风格、改细节、粗稿精修 |
| 局部重绘(inpaint) | 只对蒙版区域重新生成,其余像素保持 | 换背景、修手指、去掉多余物体 |
| 扩图(outpaint) | 向四周延伸画面,补全画布之外的内容 | 竖图改横图、海报加出血位 |
| 角色一致性 | 多参考图 + 身份 LoRA / 人脸融合,批量生成同一角色的不同场景 | AI 写真、电商模特、IP 形象 |
绘图提示词工程与通用「话术」
可控生成的另一半是提示词本身——同一模型,提示词写得好坏,出图质量可以差一个档次:
- 结构:主体(谁/什么)+ 环境(在哪/什么光/什么天气)+ 风格(画风/媒介)+ 质量词(高清/细节丰富)+ 负面(不要模糊/多余手指)。
- 权重语法:
(word:1.2)提高某词的引导权重,[word]降低;本质上调的就是 CFG 的局部「听话程度」。 - 负面提示词:写「不要的东西」比写「要的东西」更能稳定去除常见缺陷(模糊、变形、水印)。
- 长提示词:旧模型 77 token 截断,长描述会被腰斩;新模型(T5/大 VLM 编码器)已支持长文本,但「写太长反而稀释重点」的规律仍在——把最重要的词放前面。
- 与 LLM 协作:让 提示词工程 里的 LLM 把需求扩写成结构化提示词(甚至生成 ComfyUI 参数),是团队效率工具的标准做法。
ControlNet:把结构钉死
ControlNet 的跨周期价值在于:它把扩散模型从「提示词控制」推进到「结构条件控制」。文本擅长描述语义,但很难稳定约束姿态、边缘、深度、构图。ControlNet 的做法是冻结原始扩散模型(保住底模能力),复制一条可训练分支接收条件图,用零初始化的卷积把「控制残差」注入去噪各层——训练初期残差为 0,模型等价于原底模,随着训练推进控制逐渐生效。条件图(如 Canny 边缘、OpenPose 姿态、深度图)通常由预处理器从参考图提取,「预处理器负责提取条件,ControlNet 负责学会用条件」。
LoRA:把风格与身份写进小增量
LoRA(Low-Rank Adaptation)的核心是低秩分解:冻结大模型权重,只训练两个小矩阵的乘积作为权重增量。一个 1024×1024 的层全量更新要 100 万个参数,LoRA 在 r=8 时只要约 1.6 万,缩 64 倍——所以 LoRA 模型通常只有几十到几百 MB,训练只要几张到几十张图。典型用途:
- 风格 LoRA:把某画师的笔触、某品牌的视觉风格固化,批量生产风格一致的图。
- 角色/概念 LoRA:把虚拟角色、产品、IP 形象写进权重,配合提示词换场景。
- 垂直微调:动漫、建筑、产品渲染等领域的社区 LoRA 模型是最活跃的资产市场。
- 训练注意:训练数据质量决定 LoRA 质量——数据脏(模糊、错误曝光、背景杂乱)会把坏特征一起固化进去;训练不足会欠拟合(学了没学会),过度会过拟合(只会生成训练图的样子)。
- 多 LoRA 组合:风格 LoRA + 角色 LoRA 可同时加载(权重可调),但同类的多个 LoRA 叠加会互相干扰——「每类一个 LoRA、组合使用时逐类微调权重」是标准做法。
- LoRA 的边界:LoRA 学的是「增量」,不能凭空创造底模没有的概念(如底模不懂的字体或结构),也别指望 LoRA 修复底模的结构性短板(如手部)。
角色一致性与 AI 写真工作流
「同一张脸出现在不同场景」是电商与内容产品的刚需,主流方案分两条:
- 免训练(推理时条件):IP-Adapter、PuLID 等把参考人脸作为条件注入,单图可用、即时出图,适合快速试稿。
- 训练式(身份 LoRA):用户上传多张照片 → 数据清洗(人脸检测、清晰度筛选)→ 训练身份 LoRA → 模板批量生成 → 人脸后处理与质量筛选。身份可复用、批量更稳定,是高质量 AI 写真产品(如 FaceChain 类)的标准链路,但需要用户等待训练。
产品启示
角色一致性不是单个算法,而是「数据筛选 → 身份建模 → 条件生成 → 后处理评估」的完整工作流——把一致性做成稳定交付系统的关键在工程链路,不在某一个模型。
多参考图与指代编辑
2025 年起「多参考图 + 指代编辑」成为新旗舰的核心卖点(如 FLUX.2、GPT-Image、SeedEdit 类能力,以官方为准):一次输入多张图(角色 A、产品 B、风格 C),模型自动对齐各图语义,并支持「把第二张图里的杯子换到第一张的场景」这类指代操作。产品含义:
- 一致性从「训练身份 LoRA」走向「推理时给参考」,门槛降低,「秒级出同款」成为可能。
- 编辑式交互(说哪里改哪里)比「重新生成」更适合设计工作流,也更容易与业务系统(如电商后台)集成。
- 评估重点变成「指代正确率」——说哪个对象就改哪个对象,是这类模型的真正考验。
可控技术的组合使用原则
- 各管一段:ControlNet 管结构(姿态/构图/深度),LoRA 管风格与身份,提示词管语义,重绘管局部——不要指望单一技术包办。
- 控制强度梯度:结构控制最强(ControlNet 权重可调),参考控制次之(IP-Adapter 权重),语义控制最弱(提示词)——从强到弱依次满足,冲突时强者优先。
- 工作流沉淀:把「哪层控制 + 多少权重」的配置存成模板;同一个团队同一套模板,出图质量方差最小。
- 调试顺序:先不加任何控制,用提示词把主体与构图跑通 → 加结构控制(ControlNet)→ 加风格/身份(LoRA/IP-Adapter)→ 最后局部精修——每加一层控制,单独验证它带来的改变,避免「多层控制叠加后不知道是谁的锅」。
图像生成的质量与评估
质量维度
- 美学:构图、光影、风格一致性——主观但可打分(如 Aesthetic Score 等模型辅助评分)。
- 文字渲染:图中文字是否拼写正确,是 2024 年前模型的著名短板,新模型(SD 3、FLUX、GPT-Image)已大幅改善;含文案的物料仍要逐字核对。
- 细节真实感:手指、牙齿、眼睛等局部是否崩坏;边缘、纹理、光线是否自然。
- 一致性:多张图之间的角色/风格一致性,以及图生图时与原图的结构一致性——对批量生产场景是生死线。
自动化与人工评估
| 指标 | 衡量什么 | 注意点 |
|---|---|---|
| FID | 生成图与真实图的分布距离 | 衡量整体真实感,不反映单张好坏;样本量小时不稳定 |
| CLIP Score | 生成图与提示词语义对齐度 | 对风格/美学不敏感;可作为「改提示词是否变好」的快速反馈 |
| 人工打分 | 美学、可用性、品牌调性 | 事实标准;要多人打分并检查一致性 |
| 业务指标 | 可用率(可直接用的比例)、返工率、一致性通过率 | 比任何算法指标都贴近商业价值 |
- FID:生成图像分布与真实图像分布的距离,越低越好,衡量整体真实感;注意它衡量「分布相似」而非「单张好不好」。
- CLIP Score:生成图与提示词的语义对齐度,衡量「听不听话」;对风格、美学等维度不敏感。
- 人工评估:美学、可用性、品牌调性等维度只能靠人打分;产品上线前必须有人审环节,并沉淀「可接受 / 需返工 / 作废」的分级标准。
- 业务指标优先:把「可用率、返工率、一致性通过率」当产品主指标——算法指标辅助调参,业务指标决定上线。
生成容易、可控难、商用难
这是图像生成落地的真实写照:单张惊艳的图很容易得到,但「指定人物 + 指定构图 + 指定风格 + 批量生产 + 每张不翻车」是另一个量级的问题。商用前先问自己:可接受多少比例的废图?有无人审兜底?风格一致性靠什么保证?返工链路(局部重绘、图生图精修)是否顺手?
评估流程与团队分工
- 算法/工程侧:跑 FID、CLIP Score 等自动化指标,负责「模型与参数是否在变好」的快速判断。
- 设计/运营侧:按业务口径人工打分(可用/返工/作废),负责「这批图能不能用」的最终裁决。
- 产品侧:维护评测集与分级标准,把两边的结果串起来——「自动化指标选方向,人工评估定上线」,两者结论冲突时以人工为准。
- 回归机制:模型升级、LoRA 更换、提示词模板改动都要重跑评测集,防止「调好一处、崩了别处」;版本化的「评测集 + 参数包」是团队最值得投资的基础设施。
典型工作流拆解
把技术串成产品,看三个代表性工作流:
电商白底商品图
- 实拍原图(或供应商图)→ 抠图/去背景(SAM 类分割模型)→ 生成白底/场景底图。
- 图生图重绘:保持商品结构,换背景、调光效(denoising strength 控制在 0.3-0.5,太高会改坏商品)。
- 局部重绘修细节:标签、拉链、反光等穿帮区域单独重画。
- 批量一致性:固定 seed + 提示词模板 + 同一 LoRA,同一批图风格统一。
- 质量检查:自动检测(清晰度、水印残留)+ 人工抽检。
AI 写真(角色一致性)
- 用户上传 5-20 张照片 → 数据清洗:人脸检测、清晰度筛选、剔除闭眼/遮挡/重复。
- 训练身份 LoRA(约 10-30 分钟)或走免训练身份注入(IP-Adapter/PuLID,秒级)。
- 模板化生成:预设风格模板(证件照/街拍/古风)+ 姿态控制(ControlNet OpenPose)+ 风格 LoRA。
- 人脸后处理:脸部融合、超分、美肤,修掉穿帮。
- 相似度与质量筛选:人脸相似度打分 + 人工选图,不合格自动重试。
营销海报
- LLM 扩写需求 → 结构化提示词(主体/场景/风格/文字)。
- 文生图出底图(4-8 张候选)→ 选中一张精修。
- ControlNet 控版式(线稿/深度/布局参考)→ 局部重绘改元素。
- 文字渲染:用文字能力强的模型直接生成图中的字,或留白后 PS 排版。
- 终审:文案逐字校对、品牌色核对、合规检查(肖像/商标/敏感词)。
这三个工作流的共同点:分段式 + 每段有明确的质量检查点,而不是「一次生成、直接交付」。
工作流对比小结
| 工作流 | 控制关键 | 主要失败点 | 兜底手段 |
|---|---|---|---|
| 电商白底图 | 图生图强度、局部重绘 | 商品变形、水印残留 | 低强度重绘、自动检测 |
| AI 写真 | 身份注入、姿态控制 | 脸不像、表情僵硬 | 人脸后处理 + 相似度筛选 |
| 营销海报 | 版式控制、文字渲染 | 文案错字、构图失衡 | 文字逐字校对、终审 |
| 概念设计 | 风格 LoRA、提示词 | 风格漂移、元素堆砌 | 风格模板固定、少而准的提示词 |
产品视角
成本
推理成本 = 生成步数 × 单步算力,分辨率与步数直接决定价格;商用 API 按张计费(以官方页面为准),开源自部署是固定 GPU 成本,量越大越划算。粗略量级感:同样分辨率下,自部署单张成本可能比 API 低一个量级,但要算上 GPU 采购、运维与模型跟进;首图速度(秒级 vs 分钟级)与批处理能力直接影响用户体验,要实测。先按业务量算账再选型:日请求量小用 API 最省心,量大且敏感用自部署。
成本算例(量级参考,以官方页面为准):假设单张 1024 图,商用 API 单价为 P(美元/张),10 万张/月 = 10 万 × P;若换自部署(如单张 A100 卡每天可出数千张),固定成本曲线在数万张/月后开始摊薄——把「P、日生成量、GPU 成本、运维人力」代入自己的公式,拐点自然出现。别忘把「返工率」算进去:废图重试也是成本,「少而精的提示词 + 质量控制」能显著降低有效成本。
延迟与体验
- 首图时间是体感核心:秒级(少步采样/小图)适合交互式体验,分钟级(高清/复杂工作流)适合批量任务;交互式产品用「先出预览图再后台精修」两段式。
- 批处理:一次生成 4-8 张的成本远小于单张 × 8(批内共享开销),「一次出多张让用户挑」是成本与体验的双赢设计。
- 缓存:相同提示词 + 相同 seed 可以命中缓存,「同款图再生成」零成本——模板化场景(节日海报、活动物料)尤其受益。
落地场景成熟度
| 场景 | 成熟度 | 说明 |
|---|---|---|
| 电商商品图/白底图 | 高 | 图生图 + 背景替换已稳定,注意细节一致性 |
| 营销海报/社媒图 | 中高 | 文字渲染已可用,仍需人工校对文案 |
| 插画/概念设计 | 高 | 风格 LoRA 生态成熟,设计师主导 |
| AI 写真/数字人形象 | 中高 | 身份一致性工作流成熟,授权与合规前置 |
| 品牌级成片(广告 TVC 分镜) | 中 | 可做分镜草稿,不可直接交付 |
| 版权敏感商用(IP 联名) | 低 | 训练数据争议未决,谨慎评估 |
版权与合规
- 训练数据争议:生成模型的训练数据含大量网络图片,版权纠纷(包括针对 Stability AI、Midjourney 的诉讼)仍在演进,商用前评估法律风险,关注各国监管动向。
- 肖像权:生成真人脸(尤其是公众人物、素人照片换脸)需要明确授权,AI 写真类产品必须设计授权链路(用户确认肖像权、上传即授权等)。
- 深度伪造监管:各国陆续立法规制深度伪造与生成内容标识,中国已有《人工智能生成合成内容标识办法》等要求(以最新法规为准),产品要预留内容水印与标识能力。
- 内容水印与 C2PA:主流模型与平台开始内置不可见水印/元数据溯源(C2PA 标准),既是合规要求也是内容可信基础设施——用户能查「这张图是不是 AI 生成的」会逐渐成为平台标配。
- 企业采购的现实:越来越多企业客户把「训练数据来源、生成内容标识、数据留存政策」写进采购合同——选 API 时把这几条当硬指标,别只看价格。
- 知识产权归属:生成物的版权归属(用户、平台还是模型方)各国法律仍在演化,产品条款要写清楚,避免「用户生成 → 用户商用 → 平台担责」的模糊地带。
内容安全
违禁内容(暴力、色情、仇恨)过滤是上线前提,采用「输入提示词审核 + 输出图像审核」双通道;图像审核可用专门的审核模型或 API,审核的召回率与误杀率都要在业务口径下测试——误杀影响体验,漏杀影响合规。提示词侧还能做「意图拦截」(用户要求生成侵权/伪造内容时拒绝并提示),这是合规审查会看的「主动治理」证据。
生成式设计如何嵌入工作流
合理形态是「草稿 → 精修 → 人工终审」:
- AI 批量出草稿与变体(一次生成 4-8 张让设计师挑)。
- 设计师/运营用局部重绘、图生图、ControlNet 精修选定方案。
- 人工终审:文字、细节、品牌一致性、合规四道检查。
- 沉淀工作流资产:把跑通的「模型 + LoRA + 参数 + 提示词」存成模板,下一次同类需求直接复用。
把「出图质量检查」做成产品内步骤(低质量自动重试、疑似崩坏标记、相似度过滤),而不是把生成结果直接当成品。
产品化检查清单
- 质量:定好可用率/返工率基线,人工抽样流程就位
- 成本:按业务量算过 API vs 自部署的拐点
- 延迟:首图时间与批处理能力实测达标
- 一致性:批量场景的角色/风格一致性方案(参考图/LoRA)已定
- 合规:肖像/音色/商标授权链路、水印与标识、深度伪造监管应对
- 安全:输入输出双通道审核上线
- 数据:用户反馈与纠错回流成评测集与微调数据
- 度量:上线后有「可用率/返工率/单张成本」的看板,定期复盘
常见坑与排错
- 提示词堆砌:写满 300 个形容词,效果反而更差——关键信息稀释,重点词放前面,一个概念一个词,少而准。
- CFG 拉满:引导系数开太高,画面过饱和、油光、失真;先从默认值起步,只调局部(权重语法)而不是全局拉高。
- seed 玄学:同一提示词不同 seed 结果天差地别;批量一致性靠「固定 seed + 固定模板」,不是靠运气。
- 底模与 LoRA 不匹配:LoRA 有底模绑定(SD 1.5 的 LoRA 用在 SDXL 上无效),训练与推理要用同系底模;跨底模迁移要专门处理。
- 重绘范围失控:图生图 denoising strength 太高会把商品改坏,太低又看不出变化——从 0.4 起步,每次 ±0.1 调。
- 「AI 味」验收缺失:风格统一但「一看就是 AI 生成」的图,在品牌场景是硬伤——人工审美把关不可省。
- 把生成当搜索用:同一个 prompt 反复重生成,期望「下一次更准」——生成不是搜索,「准」要靠加条件(参考图/ControlNet/固定 seed),不是靠抽卡次数。
- 合规后置:肖像、商标、敏感元素等检查放到生成之后才做,返工成本高;把合规检查前置到提示词与输入图阶段。
- 忽略分辨率与显存规划:高清图(2K+)在消费级显卡上可能爆显存,VAE Tiling 与分批解码是标配;服务端要按「并发 × 分辨率」规划算力,别等线上爆了再补。
- 不做版本管理:模型、LoRA、参数、提示词都在演进,没有版本化管理的团队,三个月后「上次那个效果」无法复现——工作流与参数包要进版本库。
- 只信演示不信评测:厂商演示图都是精选样本;用你自己的业务用例集跑,「演示惊艳、用例翻车」是常态。
- 采样器与调度器乱配:换了采样器却沿用旧噪声调度,画面发灰或噪点变多;参数包要「模型 + 采样器 + 调度器 + 步数」成套记录。
- 负面提示词滥用:负面词写太多、太具体,会反向污染画面(把「模糊」当特征学走);负面提示词保持精简,只写高频缺陷。
- 不记录生成参数:出图了但没存「模型 + seed + 参数」,想复现时只能靠截图——「能复现」是生产与协作的基本要求,工具链里强制记录参数。
未来趋势
- 理解与生成统一:同一个模型既能看懂图也能改图(指代编辑:「把这个杯子换成蓝色的」),编辑交互会取代「反复生成」。
- 多参考图与角色一致性:一次给多张参考图(产品、人物、风格各一张)统一生成,一致性从「训练」走向「推理时条件」,门槛持续降低。
- 实时与端侧:少步蒸馏与端侧模型让「边画边改」成为可能,设计工具原生集成生成能力。
- 合规即能力:内容水印、溯源、授权管理从「补丁」变成产品模块,to B 采购会明确要求。
- 垂直工作流集成:生成能力会嵌入设计、电商、办公等既有工具(生成按钮进 PS/PPT/后台),「独立出图工具」的形态逐步让位给「工作流里的一个环节」。
- 个人化与隐私:本地模型 + 个人素材(自己的脸、自己的画风)生成专属内容,「隐私敏感 + 个性化需求」会催生端侧生成的主流地位。
- 3D 与多模态延伸:图像生成技术向 3D 资产、视频(见 视频生成)延伸,「一次描述,多形态产出」是终局想象。
给产品经理的最终建议
图像生成选型的三步走:先用商用 API 跑通业务闭环并积累真实用例 → 用用例集横向评测(文字渲染/指代/一致性/成本)→ 量级与敏感度达标后再评估自部署与微调。全程把「可用率、返工率、一致性」当主指标,把合规与安全前置——技术演进很快,这些产品纪律不会过时。
练习
为一个「电商商品图生成」功能设计评估方案:列出 5 个质量维度、对应的自动化指标与人工检查项,并估算 10 万张/月的成本量级(以某商用 API 页面价为准),说明你会在什么条件下切换到自部署开源模型。进阶题:为「多参考图一致性」设计 10 条评测用例(含翻车场景),并定义通过标准。
来源说明
本文为原创整理,原理部分参考 DDPM 与 LDM 论文,生态与模型信息参考以下来源,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。
- DDPM 论文:去噪扩散概率模型原理。
- LDM 论文:潜空间扩散与 Stable Diffusion 框架。
- Stability AI 官方:Stable Diffusion 系列模型与生态。
- FLUX(Black Forest Labs):FLUX.1/FLUX.2 系列。
- AIGC 面试书图像生成系列笔记(预取资料
sources/image/):扩散模型、SD/FLUX、LoRA、ControlNet、GAN 等技术脉络。 - 站内:多模态理解、视频生成、模型能力与边界、提示词工程。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用