人工智能面试题更新 2026-08-05

请解释 Stable Diffusion 的核心工作原理是什么?

人工智能技术原理Stable Diffusion

考察说明

考查对Stable Diffusion生成模型机制的理解程度,包括训练和推理流程

回答思路

  1. 【回答框架 1】Stable Diffusion是一种基于潜在扩散模型的文本生成图像技术,核心是将扩散过程应用于低维潜在空间而非像素空间。它包含两个主要阶段:前向过程逐步向图像添加噪声,反向过程学习去噪以生成图像。
  2. 【回答框架 2】模型架构由三部分组成:变分自编码器将图像压缩到潜在空间,U-Net负责在潜在空间中预测噪声,文本编码器将文本提示转换为条件向量。训练时通过最大化似然目标优化U-Net的去噪能力。
  3. 【回答框架 3】推理过程从纯噪声开始,在文本条件引导下逐步去噪,最终通过变分自编码器解码器将潜在表示还原为图像。这一设计显著降低计算资源需求,使高分辨率图像生成成为可能。
  4. 【关键点 1】Stable Diffusion在潜在空间执行扩散过程,而非像素空间
  5. 【关键点 2】核心架构包含变分自编码器、U-Net和文本编码器
  6. 【关键点 3】推理时逐步去噪并进行条件引导,最终通过解码器生成图像
  7. 【易错点 1】不要将Stable Diffusion与VAE混为一谈,VAE只负责图像压缩与重建
  8. 【易错点 2】不要遗漏文本条件在去噪过程中的引导作用