从GAN到Stable Diffusion:AI绘画的七年进化之路
红鼻子小黑_w
2026年06月08日 20:44

2017年,当我第一次用GAN生成模糊的动漫头像时,我并没有意识到这会是AI视觉领域黄金时代的开端。彼时的人们很难想象,七年后,只需一句话描述,AI就能生成照片级真实的图像。

这篇文章,我想聊聊AI绘画从GAN到Stable Diffusion的完整演进路径,以及我个人的一些观察与思考。

|GAN时代:对抗中诞生的想象力

2014年,Ian Goodfellow提出了GAN(生成对抗网络),这个框架的思路相当有意思:两个神经网络——生成器和判别器——相互博弈,生成器努力造假,判别器努力打假。当判别器再也无法分辨真假时,生成就成功了。

早期GAN生成的图像质量相当有限,分辨率低、细节缺失、且训练极不稳定。我记得2017年前后,Conditional GAN和Progressive GAN算是当时相对成熟的工作,能生成256×256的还算像样的人脸。但即便如此,GAN的致命缺陷是模式崩溃——生成器往往只学会复制少数几个样本,无法真正理解数据分布。

个人理解:GAN更像是让机器学会了模仿,而非真正的创作。它的能力边界很大程度上受限于判别器的鉴别能力。

|VAE与Diffusion:另一条路

在GAN大行其道的同时,变分自编码器(VAE)和自回归模型也在悄悄发展。VAE通过编码-解码结构学习潜在空间,生成的图像更平滑,但细节不够锐利。

真正的转折来自Diffusion Model(扩散模型)。2020年 DDPM 论文发布时,学术圈并没有太大动静——采样速度太慢是致命伤。但到了2021年,OpenAI的Classifier-Free Guidance和improved DDPM让速度有了数量级的提升。

|CLIP与多模态:让AI理解文字

2021年,OpenAI发布的CLIP是一个标志性事件。它用互联网级的图文配对数据训练,让模型真正理解了这张图是什么意思。CLIP将文本嵌入和图像嵌入对齐到同一空间——从此,按文字生成图像从玄学变成了工程问题。

|Stable Diffusion:开源的革命

2022年8月,Stability AI以Latent Diffusion Model为基础,发布了Stable Diffusion。这个模型的核心创新在于:不在像素空间,而在压缩后的潜在空间进行扩散过程。这让512×512图像的生成从数小时缩短到几秒。

开源意味着什么?意味着全球开发者可以在此基础上微调、组合、控制。ControlNet、LoRA、ComfyUI……整个AI绘画生态在几个月内爆发式生长。我自己跑过好几个开源ControlNet模型,那种精准控制的感觉,是此前所有工具都无法提供的。

个人理解:SD真正把AI绘画从展示技术变成了创作工具。之前大家玩的是Demo,之后大家用的是产品。

|DALL-E 3、Midjourney与GPT-4V的冲击

2023年后,闭源模型继续进化。DALL-E 3在语义理解上大幅提升,Midjourney靠着社区运营和精美的出图效果吸引了大量创作者。但最让我惊讶的是GPT-4V等多模态模型的加入——AI不只是生成图像,它开始能够理解、评价、甚至反思自己生成的图像。

|结语

七年时间,AI绘画从能生成一张模糊的图进化到能精准理解我的创作意图。GAN教会我们对抗与博弈,Diffusion教会我们噪声与复原,CLIP教会我们语义与关联,Stable Diffusion教会我们开放与生态。

作为亲历者,我最大的感受是:技术迭代的速度远超预期,但真正改变创作生态的,往往不是最尖端的技术,而是那些降低门槛、让普通人也能用起来的开源工具。

下一步,AI绘画会走向何方?我倾向于认为,多模态理解与个性化微调会是下一个主战场。

话题:#AI绘画 #人工智能 #AIGC #Stable_Diffusion #GAN