扩散模型

Diffusion Model

扩散模型(Diffusion Model)是一类通过「逐步加噪-去噪」过程生成图像、音频或视频的生成式 AI 模型,是 Stable Diffusion、Sora 等明星产品的底层架构。

详细解释

扩散模型(Diffusion Model)的灵感来自非平衡热力学。模型分两步工作:

  1. 前向扩散(Forward Process):往训练图像上逐步加高斯噪声,经过数百步后变成完全随机噪声。
  2. 反向扩散(Reverse Process):训练一个神经网络(通常是 U-Net + Transformer),学会从纯噪声一步步「去噪」,最终生成清晰图像。

数学直觉

如果用 x_0 表示原图,x_T 表示纯噪声,模型学到的就是反向条件概率(每一步预测噪声均值 μ 和协方差 Σ):

p_θ(x_{t-1} | x_t) = N(x_{t-1}; μ_θ(x_t, t), Σ_θ(x_t, t))

训练目标是预测每一步添加的噪声 ε,损失函数:

L = E[ ||ε - ε_θ(x_t, t)||² ]

主流扩散模型

模型公司特点
Stable Diffusion 3Stability AI开源、文生图王者
DALL·E 3OpenAI文字渲染优秀
Imagen 3Google写实风格
Midjourney V7Midjourney艺术风格
SoraOpenAI视频生成、60s 长视频
可灵 / 通义万相快手 / 阿里国产视频生成

唯元智创中的扩散模型

唯元智创平台已接入国产开源扩散模型(如 Stable Diffusion 3 中文微调版、智谱 CogView),通过统一 API 调用,文生图 0.008 元/张起,支持 LoRA 风格定制。

常见问题

扩散模型和 GAN 哪个更好?
扩散模型训练更稳定、生成质量更高、模式覆盖更全(多样性更好);GAN 推理更快但容易模式崩溃(Mode Collapse)。
扩散模型能生成视频吗?
可以。把 3D U-Net 换成时空 Transformer,就能在潜空间同时去噪时间和空间维度,这就是 Sora、可灵的核心思路。