扩散模型是如何实现 AI 绘画的
输入一句话就能生成一张图,背后主流的技术是扩散模型(Diffusion Model)。它的思想出乎意料地直观:先学会把图片一步步破坏成噪声,再学会把噪声一步步还原成图片。生成时从纯噪声出发逆向还原,就”画”出了一张新图。
前向扩散:加噪
训练的第一半是破坏过程:
- 拿一张真实图片,按固定计划逐步加入高斯噪声
- 经过足够多步后,图片变成纯噪声,信息完全丢失
这个过程是预定义的、不需要学习的,它的作用是为模型制造”从噪声到图片”的各种中间状态样本。
反向去噪:生成
训练的第二半是学习还原:
- 训练一个神经网络(通常是 U-Net),输入”带噪图片 + 当前步数”,预测本轮加入的噪声
- 把预测的噪声减掉,就得到更干净一点的图
- 损失函数衡量预测噪声与真实噪声的差距
生成时从随机纯噪声开始,重复”预测噪声→减去→更清晰”几十步,最终得到一张训练集中从未存在过的新图。模型学的不是复制图片,而是自然图像的分布规律。
文本如何控制画面
纯扩散模型只能随机生成,让”文字指挥画画”靠的是条件注入:
- 用文本编码器(如 CLIP)把提示词转成语义向量
- 通过交叉注意力机制,在每一步去噪时让图像特征”关注”文本语义
- 提示词说”雪中的狐狸”,去噪方向就被引导向符合该语义的图像分布
负面提示词(negative prompt)同理:告诉模型每一步要”远离”哪些语义。
Stable Diffusion:把扩散搬进潜空间
直接在像素空间做扩散计算量巨大。Stable Diffusion 的关键优化:
- 先用 VAE 编码器把图片压缩到低维潜空间(如 64x64)
- 在潜空间里做扩散与去噪,最后用 VAE 解码器还原成像素图
计算成本下降一个数量级,消费级显卡也能跑,这才有了 AI 绘画的全民爆发。LoRA 微调则让普通人用几十张图就能训练自己的画风模型。
能力与边界
扩散模型擅长质感、光影与创意组合,但也有边界:文字渲染、手部结构等精细约束仍易出错;生成内容受训练数据版权与偏见影响。理解”加噪-去噪”的原理后就能明白:AI 绘画不是拼贴素材,而是模型在语义引导下从噪声中”雕刻”出符合分布的图像——这既是它创造力的来源,也是它偶尔”画不对”的原因。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 非鱼小站!
评论
WalineDisqus







