Stable Diffusion 入门:本地部署与核心概念
更新日期:2026-09-30 | 信息来源/适用工具:Stability AI 官方公开页面(stability.ai,2026-09-30 访问)+ Stable Diffusion 开源项目与社区公开资料(文中已标注);原理部分为通用技术知识
本文为工具认知与部署概念参考,不含实测对比;模型版本、许可条款与硬件要求以官方与社区当前说明为准。
Stable Diffusion(SD)是 2022 年开源的文生图模型,它把"AI 生图"从云端服务带到了消费级显卡上——这也是它和 Midjourney 类云端工具最根本的分野:SD 装在你自己的电脑里。
为什么今天还值得学它?三件事云端工具给不了:可控(模型、参数、插件全在你手里)、私有(素材不出本机)、零边际成本(出多少张都不按张付费)。
一、原理三句话
- 扩散:模型学的是"去噪"——从一团随机噪声出发,一步步预测并减掉噪声,最后"显影"出图(类似照片在显影液里慢慢显现);
- 潜空间:SD 不在像素层直接算,而是先把图像压缩到低维"潜空间"里运算,大幅降低算力需求——这是消费级显卡能跑大模型的关键;
- 三个组件:CLIP 把提示词翻译成向量,U-Net 负责逐轮去噪,VAE 把潜空间结果解码回像素图像。
二、五个核心概念:认准这些文件再下载
| 概念 | 是什么 | 常见体量 |
|---|---|---|
| Checkpoint(底模) | 生成必须的基础模型,决定画风与擅长领域 | 2–7 GB |
| LoRA | 轻量微调件,固定特定人物/风格/服饰 | 10–200 MB |
| VAE | 画质"滤镜",负责色彩与细节的解码 | 约 300 MB |
| ControlNet | 用姿态、边缘(Canny)、深度图等条件控制结构 | 分模型而定 |
| Embedding | 一组打包的提示词向量,控图能力有限 | 几十 KB |
搭配逻辑:底模 + 多个 LoRA + 合适的 VAE,需要控制构图/姿态时再挂 ControlNet——LoRA 必须在底模之上使用,不能单独出图。体量为社区常见口径,以实际下载源为准。
三、两条操作路线
| 路线 | 形态 | 适合 |
|---|---|---|
| WebUI(如 AUTOMATIC1111 等) | 表单式界面,填参数、点生成 | 新手入门、快速出图 |
| ComfyUI | 节点式工作流,把"加载模型→编码→采样→解码"连成图 | 深度用户、可复用工作流、复杂管线 |
一句话区分:WebUI 像点套餐,ComfyUI 像开放式厨房——确定性(同一工作流一键复现)和可复用性(工作流可保存、分享)是 ComfyUI 的核心价值。
四、部署路径:先想清楚装哪一档
据 Stability AI 官方页面(2026-09-30 访问),当前官方主推 Stable Diffusion 3.5,分三档:
- Large——质量与提示词遵循最强,面向专业场景(官方标注 1 megapixel 分辨率);
- Turbo——速度优先,官方称可"四步"出高质量图;
- Medium——面向消费级硬件,在质量与定制间取平衡。
官方提供自托管许可、API、云平台合作等多种部署方式,另有 SDXL、SDXL Turbo 等更早的模型可选;此外官方还有 Edit(编辑)、Upscale(放大)、Control(控制)等图像服务。
中文社区的现实路径:多数新手从第三方"整合包"起步(预装环境、开箱即用),跑通后再自建环境——整合包来自社区,注意来源可信度与版本更新。
五、硬件与避坑(社区经验口径)
- 硬件:NVIDIA 显卡体验最顺(社区经验:6 GB 显存起,4 GB 有低显存方案但吃力);SDXL 及以上对显存要求更高;
- 模型来源:优先下载
.safetensors格式(只存权重,安全性更好),谨慎加载来源不明的.ckpt文件; - 第一次别追求完美:先跑通"默认底模 + 一个 LoRA"的最小组合,再逐步加 ControlNet;
- 一致性玩法:LoRA 训练是"角色一致性"的本地化解法——短剧角色锚定方法可先读角色一致性专项。
六、常见问题
Q:一定要很贵的显卡吗? 起步可以低配(见上);但要跑 SDXL 及 SD 3.5 级别的大模型,显存越宽裕越顺。原则是:先用现有硬件跑通流程,高频用到它再考虑升级。
Q:出图"手崩"怎么办? 优先在生成阶段解决:调整正向/负面提示词,或缩短画面里的手部占比;再不行用局部重绘修,修不动就换种子重出——和视频剪片"修不动换镜头"是同一个止损逻辑。
Q:模型和 LoRA 去哪下载? 主流渠道是公开模型社区(如 Hugging Face、Civitai 等);下载前看两样:模型许可(商用范围)与文件格式(优先 safetensors)。
七、它适合谁
批量出图(电商商品图工作流见AI 商品图怎么做)、素材涉密不便上云、需要固定风格/人物的长期项目。若你只是想快速出概念图、不想折腾硬件——云端方案更省事,对比见AI 绘画工具全景与Midjourney 入门。
📖 这只是基础。《AI 短剧·爆款生产线》课程覆盖 AI 出图到成片的完整生产线——角色一致性、场景资产、图生视频与审片标准,工具取舍与多工具协同:查看课程详情 →
返回内容创作栏目 | 相关阅读:AI 绘画工具全景 | Midjourney 入门
