
在 AI 绘画的领域里,如果说 Midjourney 是一位优雅的“艺术家”,那么 Stable Diffusion(SD)就是一位无所不能的“工程师”。作为目前开源界最强大的图像生成模型,SD 以其极高的自由度、可定制性和本地部署的安全性,成为了追求极致控制力的设计师、创作者和开发者的首选工具。获课 ♥》
本文将带你深入 SD 的四大核心板块,助你从入门到精通,真正驾驭这台“视觉造梦机”。
文生图是 SD 的基础功能,但要在 SD 中获得高质量的结果,远不止输入一句话那么简单。你需要理解“模型”与“参数”背后的协作逻辑。
SD 的核心在于大模型。不同于 MJ 的统一云端模型,SD 允许你加载任何底模。(bcwit.top/14973)
写实类: 如 Realistic Vision 或 ChilloutMix,擅长生成如同相机拍摄般的真人照片、光影效果,适合人像摄影、电商图。
二次元类: 如 Anything 或 CounterfeitV,专为动漫风格打造,线条清晰,色彩鲜艳,适合插画创作。
设计类: 如 Deliberate,兼顾了写实与艺术感,通用性极强。 要点: 选择一个与你目标风格高度契合的大模型,等于成功了一半。
SD 的提示词系统由“正向提示词”和“负向提示词”组成。
正向: 描述你想要的一切。不仅要写主体(如“一个美丽的女孩”),更要写修饰词(如“杰作、8k分辨率、电影级光效、精细的皮肤纹理”)。在 SD 中,权重非常重要,使用括号可以加强词语权重,减少数值则降低权重。
负向: 排除你不想看到的。通用词包括“低质量、模糊、多余的手指、水印、变形”等。负向提示词是画质的“守门员”,能有效净化画面。
采样器: 推荐使用 DPM++ 2M Karras 或 Euler a,前者收敛快适合写实,后者随机性强适合艺术创作。
迭代步数: 一般设置在 20-30 步即可。太少画面未完成,太多不仅浪费时间且画质未必提升。
提示词相关性(CFG Scale): 数值越高,AI 越严格听从你的指令;数值越低,AI 发挥空间越大。通常建议设置在 7 左右,以平衡指令与创意。
如果说文生图是“盲盒”,那么图生图就是“精修”。这是 SD 优于其他工具的核心竞争力,特别是结合 ControlNet 之后。
图生图允许你上传一张图片,让 AI 参考其构图、色调或内容生成新图。
重绘幅度: 这是灵魂参数。
低数值(0.3-0.4): 画面几乎不变,主要改变光影、材质或轻微优化细节。适合给老照片上色或提升画质。
中数值(0.5-0.7): 保持构图,但改变画面内容和风格。适合将照片转油画,或将素描转写实。
高数值(0.8+): 彻底颠覆原图,仅保留模糊的轮廓或色块。
当你对一张图的某一部分不满意(例如手画崩了、想换个发型),可以使用局部重绘。
蒙版绘制: 用笔刷涂抹你想修改的区域。
填充逻辑: 选择“填充”方式,AI 会根据蒙版边缘的像素进行脑补。
应用场景: 换脸、换装、修补瑕疵、甚至是无中生有地在背景里添加一座城堡。
这是 SD 生态中最伟大的插件之一。它允许你上传一张额外图片来控制生成图的“结构”。
Canny 边缘检测: 提取线条。如果你上传一张线稿,SD 会严格在线稿内上色。
OpenPose 姿态识别: 提取骨架。上传一张人物跳舞的照片,SD 能让任何角色摆出完全一样的姿势。
Depth 深度图: 提取空间前后关系。保证画面透视不崩坏。 总结: ControlNet 解决了 AI“不会画画”的问题,让它拥有了美术学院毕业生的造型能力。
SD 不仅能画图,结合特定工具还能生成极具冲击力的短视频。虽然 SD 本身是静态模型,但通过“帧序列生成”可以实现动画效果。
最简单的动画原理是“连续播放”。
种子游走: 固定提示词,让“随机种子”在两个数值之间缓慢变化。AI 会生成一系列逐渐变形的图片,连贯播放后就会产生如梦似幻的变形动画。
XY 表格批量生成: 批量生成某个动作的中间状态(如从站立到蹲下的中间帧),然后通过剪辑软件合成。
目前社区有非常成熟的插件(如 AnimateDiff),可以让 SD 直接生成视频。
运动模块: 加载这些模块后,SD 能理解“时间”概念,保持角色在多帧画面中的一致性。
控制帧率: 调整生成参数,控制动画的流畅度和抖动感。
应用场景: 制作循环动态背景、炫酷的 MV 视觉素材、产品展示的动态渲染图,甚至是 AI 短片的分镜草稿。
这是 SD 玩家的终极追求:训练你自己的模型。LoRA 是一种轻量级的微调技术,不需要昂贵的显卡,就能让 SD 学会特定的脸、画风或物体。
人物专练: 训练你自己、家人或宠物的脸。以后在任何风格的图中,都能召唤出这张脸。
画风专练: 收集某位画师或某种艺术风格(如水彩、蒸汽朋克)的图,训练后让 SD 掌握这种笔触。
概念/物体: 训练特定的服装(如钢铁侠战甲)、Logo 或特定的虚构物体。
数据集准备: 这是重中之重。你需要准备 10-20 张高质量、纯背景、多角度的图片(若是训练人脸,必须包含五官清晰的正侧脸)。
打标: 使用工具自动或手动给图片打标签,告诉 SD 图里是什么。
触发词: 给你的 LoRA 起一个独特的名字(如“mycat”)。训练完成后,只要在提示词里输入“mycat”,你的专属形象就会出现。
不要训练太久,否则 LoRA 会“死板”,只能画出训练集里的样子,无法换装或换动作。学会观察 Loss 值曲线,适时停止。
LoRA 的组合拳: SD 的强大在于它可以同时调用多个 LoRA。你可以同时挂载:人物 LoRA + 服装 LoRA + 风格 LoRA,实现无穷无尽的创意组合。
Stable Diffusion 的学习曲线虽然比 Midjourney 陡峭,但它给予你的回报是无限的可能性。从精准控制每一个像素的文生图,到结构严谨的图生图,再到动态的视频生成和个性化的 LoRA 训练,SD 实际上是一套完整的视觉生产系统。
不要被复杂的参数吓退,先从选对一个好看的大模型开始,输入你的第一行提示词。当你第一次通过 ControlNet 完美还原心中的构图,或是看到训练出的 LoRA 成功生成熟悉的脸庞时,你会发现,所有的付出都是值得的。