从像素到潜空间:精读 Latent Diffusion Models,理解 Stable Diffusion 的方法底座

发布时间:2026/9/2 17:36:34
从像素到潜空间:精读 Latent Diffusion Models,理解 Stable Diffusion 的方法底座 从像素到潜空间精读 Latent Diffusion Models理解 Stable Diffusion 的方法底座原论文High-Resolution Image Synthesis With Latent Diffusion Models作者Robin Rombach、Andreas Blattmann、Dominik Lorenz、Patrick Esser、Björn Ommer会议CVPR 2022pp. 10684–10695DOI10.1109/CVPR52688.2022.01042原文CVF Open Access arXiv:2112.10752 官方代码30 秒看懂这篇论文研究问题像素空间扩散模型质量高但训练和采样都要反复处理高分辨率 RGB 张量计算代价过大。能否把扩散过程搬到一个更小、又不丢失关键视觉信息的空间核心方法先训练一个带感知损失和对抗损失的自编码器把图像压缩成二维潜表示再冻结它在潜空间训练扩散模型。条件信息则通过拼接或 cross-attention 注入 U-Net。关键发现压缩不是越少越好也不是越多越好。论文的实验显示空间下采样因子 (f4) 或 (f8) 通常处在质量与效率的甜点区间。主要贡献把高保真图像重建、扩散生成与通用条件控制拆成可复用的两阶段系统使文本生成、语义图生成、超分辨率和修复可以共享一套基本框架。最大局限第一阶段自编码器决定了可恢复信息的上限一旦细节在压缩时被丢掉第二阶段扩散模型无法凭空找回。不同任务的对比实验也并非全部在完全一致的算力和数据条件下完成。一句话概括LDM 的真正突破不是“把图压小”这么简单而是找到一个既保留感知信息、又适合卷积扩散建模的二维潜空间并用 cross-attention 把它变成通用条件生成器。1. 为什么像素空间扩散模型太贵扩散模型把生成写成一个逐步去噪过程。训练时网络在随机时间步接收加噪图像并预测噪声采样时又要连续调用同一个去噪网络几十到上千次。若每一步都在 (H\times W\times3) 的像素网格上运行高分辨率带来的显存、计算量和时间开销会被采样步数进一步放大。论文把图像中的信息分成两类。第一类是高频、局部、对逐像素误差敏感却未必影响人类感知的细节第二类是物体、布局、形状和语义等决定“图像是什么”的信息。像素扩散模型虽然会在训练中逐渐学会忽略部分无关细节但网络仍然必须对所有像素执行计算。作者的主张是与其让昂贵的生成模型同时承担感知压缩和语义建模不如先用一个专门的自编码器完成较温和的感知压缩再让扩散模型集中学习潜表示的分布。**图 1论文 Figure 1正文第 1 页**比较了不同压缩方式的重建。DALL·E 使用 (f8) 的离散压缩VQGAN 使用 (f16)而作者的 (f4) 自编码器在示例中保留了更忠实的结构和细节。这里最值得注意的不是某一个 PSNR 数字而是实验逻辑生成模型最终输出必须经过解码器因此自编码器的重建能力构成了整个系统的“质量天花板”。过强压缩会让后续生成再强也无济于事。**图 2论文 Figure 2正文第 2 页**给出了作者最重要的概念图。自编码器负责沿率失真曲线完成感知压缩潜空间中的扩散模型负责语义压缩也就是学习哪些潜变量组合对应有意义的图像。两种压缩拆开后第一阶段可以复用第二阶段可以针对不同条件和任务重新训练。2. 方法一个冻结的自编码器加一个潜空间扩散模型2.1 第一阶段学习“感知等价”的潜空间编码器 (E) 把图像 (x\in\mathbb{R}^{H\times W\times3}) 映射成 (z\in\mathbb{R}^{h\times w\times c})解码器 (D) 再将 (z) 还原为图像。空间下采样因子定义为 (fH/hW/w)。与把整张图压成一串 token 的强离散压缩不同LDM 保留二维空间结构因此后续仍可使用卷积 U-Net 的局部归纳偏置。自编码器使用感知损失与 patch-based 对抗目标训练。前者鼓励重建在高级视觉特征上接近原图后者改善局部纹理的真实感。论文研究了两种正则化KL-reg对潜变量施加轻量 KL 约束VQ-reg使用向量量化层但量化层由解码器吸收。重要的是这一步完成后参数被冻结扩散训练不会继续改变潜空间。这种解耦避免了“重建质量”和“生成先验”联合训练时难以权衡的问题。2.2 第二阶段在 (z) 上做扩散像素扩散的基本噪声预测目标没有被推翻只是输入从 (x_t) 换成了 (z_t)训练时先用冻结的编码器得到 (zE(x))随机选择时间步并加入高斯噪声再让时间条件 U-Net 预测噪声。采样完成后只需一次解码 (D(z_0)) 就能回到图像空间。由于 (h,w) 显著小于 (H,W)每一步 U-Net 的计算量下降而潜表示仍保留足够空间细节。2.3 条件控制cross-attention 才是通用性的关键**图 3论文 Figure 3正文第 4 页**把系统完整串了起来左侧是编码器和解码器中间是潜空间去噪 U-Net右侧是条件编码器。空间对齐的条件如语义分割图或低分辨率图像可以直接与 U-Net 输入拼接文本、类别、布局等更一般的条件则先由领域编码器 τθ 转成 token 表示再通过 cross-attention 进入 U-Net 的中间层。对某层 U-Net 特征 φᵢ(zₜ)查询 (Q) 来自图像潜特征键 (K) 和值 (V) 来自条件表示 τθ(y)这一步把“生成什么”与“如何逐步去噪”连接起来。它并非只服务于文本提示词只要条件能够被编码成序列就可以用同一接口控制生成。后来的文本到图像系统广泛沿用了这种设计但要强调这篇 CVPR 2022 论文提出和验证的是 LDM 框架不能把论文中的 1.45B 文本模型直接等同于后来发布的 Stable Diffusion 产品模型。3. 最关键的实验压缩率存在甜点区间如果只说“潜空间更省算力”结论并不充分因为更强压缩天然会降低计算量却可能牺牲质量。论文真正有说服力的部分是在相同模型规模、相同训练步数、单张 NVIDIA A100 的条件下系统比较 (f\in{1,2,4,8,16,32})。其中 LDM-1 等价于像素空间模型。**图 5论文 Figure 5正文第 5 页**展示 ImageNet 类别条件生成的训练轨迹。(f1) 和 (f2) 每一步太贵在相同墙钟时间内学习进展缓慢(f32) 虽然便宜但第一阶段丢失的信息太多FID 和 Inception Score 很快遇到上限。(f4\sim16) 的表现明显更好论文随后把 (f4) 与 (f8) 视为最稳定的区域。**图 6论文 Figure 6正文第 5 页**从推理侧验证同一结论。横轴是每秒样本数纵轴是 FID每条曲线上的点对应 10、20、50、100、200 个 DDIM 步。CelebA-HQ 与 ImageNet 上LDM-4/8 同时获得更好的质量—吞吐折中。这个结果说明优势不只是“少跑几步”而是每一步处理的空间张量更小。这里应当克制地读数字。图 5 和图 6 的内部消融控制较严格能够支持“中等压缩优于两端”的因果判断但跨论文 SOTA 表格混合了不同数据处理、模型规模、训练资源和采样器更适合说明竞争力不能视为严格等算力竞赛。4. LDM 如何覆盖多种生成任务4.1 无条件、类别条件与文本条件生成论文在 CelebA-HQ、FFHQ、LSUN-Churches、LSUN-Bedrooms 和 ImageNet 上评估无条件或类别条件生成。ImageNet 256×256 实验中未引导 LDM-4 报告 FID 10.56加入 classifier-free guidance 后 FID 降至 3.60同时 Precision 上升而 Recall 下降。这提醒我们引导会把样本推向更符合条件、更高密度的区域但也可能牺牲覆盖度FID 变好不等于多样性全面改善。**图 7论文 Figure 7正文第 6 页**上半部分是 COCO 布局到图像下半部分是文本到图像。文本模型约 1.45B 参数使用 BERT tokenizer 和 Transformer 条件编码器在 LAION-400M 上训练。MS-COCO 验证集上LDM-KL-8 报告 FID 23.35使用 scale1.5 的 classifier-free guidance 后为 12.61。样例证明 cross-attention 能处理开放文本但这些结果也受训练数据规模、文本—图像配对噪声及指标偏好影响。4.2 卷积式外推训练 256²生成更大画面**图 8论文 Figure 8正文第 7 页**显示一个在 256×256 裁剪上训练的语义合成模型可以卷积式应用到 512×1024。原因在于潜表示和 U-Net 都保留空间结构语义图又与生成区域对齐。不过这不是任意分辨率都自动稳定作者在补充材料中特别讨论了潜变量尺度和信噪比说明高分辨率外推依赖正确的 latent rescaling并非零成本能力。4.3 超分辨率感知真实与结构一致并不等价**图 9论文 Figure 9正文第 7 页**比较 bicubic、LDM-SR 与 SR3。LDM-SR 的纹理更锐利、视觉上更真实但 SR3 在猫的眼睛、汽车轮辐等细结构上更连贯。论文也明确指出PSNR/SSIM 偏爱平均化和模糊结果与人类感知并不完全一致。对超分辨率而言“看起来真实”和“忠实恢复原始细节”是两个目标生成式方法可能补出合理纹理却不保证那就是原图中存在的纹理。4.4 图像修复效率提升但结果需要语义判断**图 10论文 Figure 10正文第 8 页**展示目标移除模型根据周围场景填补被遮挡区域。论文在 Places 数据上比较像素扩散和 LDM报告潜空间方案至少约 2.7 倍的训练/采样加速并改善 FID。大型模型经过 512² 微调后在 40%–50% 遮挡设置上获得 FID 9.39。不过单张视觉示例不能证明修复内容“真实”它只能说明输出在语义和纹理上合理用于取证、医学等要求事实一致的场景时这种生成能力反而需要格外谨慎。5. 证据是否足以支持作者的主张我认为论文对三个核心主张的支持强度不同。第一潜空间扩散能显著改善效率—质量折中证据最强。论文不仅给出最终 FID还控制 GPU、步数与参数规模比较训练进展和采样吞吐正文与补充材料又列出第一阶段模型、训练配置和资源消耗。中等压缩率优于像素空间和过强压缩的结论经得起图 1、5、6 的交叉验证。第二同一框架可统一多种条件任务证据较强。文本、布局、语义图、低分辨率图和掩码分别通过 cross-attention 或拼接接入任务覆盖面广且不需要为每个任务发明完全不同的生成骨干。这里的贡献主要是架构接口和工程可复用性而不是每一项下游任务都以绝对优势击败专用模型。第三**“不降低质量”**应理解为宏观感知指标和样例上的近似成立而非信息无损。第一阶段的重建 FID、PSNR 已经表明压缩会改变图像超分辨率示例也显示真实纹理与精确结构可能发生冲突。FID、IS、Precision/Recall 衡量的是样本分布的某些投影无法覆盖文本一致性、局部几何、事实性和安全性。6. 这篇论文最重要的贡献不只是降算力把生成问题拆成可复用的两阶段系统。自编码器解决“哪些像素细节值得保留”扩散模型解决“潜表示如何分布”。冻结接口让一个第一阶段服务多个第二阶段任务。保留二维潜结构。与高度压缩的一维 token 序列相比二维 latent 仍适合卷积网络、空间拼接和卷积式大图采样。把 cross-attention 变成通用条件入口。文本、类别和布局只需更换条件编码器不必重写扩散过程。用系统消融给出工程选择。(f4/8) 不是拍脑袋设定而是重建上限、训练速度与采样质量共同决定的折中。代码和模型开放。官方仓库给出了第一阶段与 LDM 配置使方法从论文概念变成可复查的研究基础设施。7. 局限今天重读时尤其要注意什么自编码器是不可突破的瓶颈。小文字、细线、精确人脸特征或科学图像中的微弱信号可能在第一阶段就被感知损失和对抗目标弱化。潜空间不是天然“语义正确”。它由重建目标塑造欧氏距离和噪声尺度未必对应人类语义距离补充材料中的 latent rescaling 也说明数值尺度会影响扩散信噪比。跨方法比较并非完全同条件。表格中的数据集、训练预算、参数量、采样步数与评估实现存在差异。最可信的是论文内部控制变量消融而不是每一个加粗的 SOTA 数字。大规模网络数据带来数据治理问题。文本模型依赖 LAION-400M。论文重点是效率与架构没有充分处理版权、偏见、隐私和不当内容生成这些不能由技术指标自动化解。卷积式大图生成不是无限外推。分辨率变化会改变潜变量统计和有效信噪比边界一致性、长程结构与显存仍会限制实际尺寸。LDM 不等于 Stable Diffusion。这篇论文提供关键方法底座后续系统还涉及不同数据、文本编码器、训练策略、安全组件和产品化工程。把二者完全画等号会误读论文的实验对象。8. 如果要复现最小可行路线是什么不建议一开始就复现 1.45B 文本模型。更合理的路线分三层第一层只验证第一阶段。选择较小数据集训练或加载 KL-reg/VQ-reg 自编码器报告重建图、PSNR、LPIPS 和 reconstruction FID。重点观察文字、眼睛、重复纹理等脆弱细节并确认 latent 的均值和方差。第二层复现压缩率消融。固定 U-Net 参数量、训练步数、采样器和 GPU比较 (f1,4,8,16)。同时记录每步时间、显存、总训练时长、FID 与吞吐而不是只看最终样例。这一步最能检验论文的核心因果主张。第三层增加一个条件任务。语义图或低分辨率图可用拼接文本用 cross-attention。先检查条件是否真正控制输出再讨论美观程度。文本任务还应记录数据来源、过滤方式和失败样例。复现时需要锁定官方仓库版本、配置文件、第一阶段 checkpoint、潜变量缩放系数、采样步数与 guidance scale。只写“使用 LDM-4”远远不够因为 KL/VQ 正则、U-Net 大小、注意力层和数据预处理都会改变结果。总结这篇论文的价值在于它没有简单追求更大的扩散网络而是重构了计算发生的位置先用温和的感知压缩去掉昂贵而次要的像素细节再在二维潜空间学习语义分布并用 cross-attention 接入多种条件。实验表明 (f4/8) 往往能兼顾重建上限、训练速度和采样质量文本生成、语义合成、超分辨率与修复则验证了框架的通用性。读完后最该记住的不是“latent 比 pixel 快”而是一个更一般的判断标准表示空间的选择本身就是生成模型设计的一部分。压缩带来的效率收益必须与被压掉的信息、评价指标的盲区和任务的真实性要求一起衡量。参考资料与图片来源Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.High-Resolution Image Synthesis With Latent Diffusion Models. CVPR 2022, 10684–10695。正文与补充材料均来自 CVF Open Access。本文 9 张图片均为论文正文 Figure 1、2、3、5、6、7、8、9、10 的忠实页面裁剪未生成、重绘、添加箭头或修改图像语义。

相关新闻