扩散模型
Diffusion Model
扩散模型(Diffusion Model)是一类通过「逐步加噪-去噪」过程生成图像、音频或视频的生成式 AI 模型,是 Stable Diffusion、Sora 等明星产品的底层架构。
详细解释
扩散模型(Diffusion Model)的灵感来自非平衡热力学。模型分两步工作:
- 前向扩散(Forward Process):往训练图像上逐步加高斯噪声,经过数百步后变成完全随机噪声。
- 反向扩散(Reverse Process):训练一个神经网络(通常是 U-Net + Transformer),学会从纯噪声一步步「去噪」,最终生成清晰图像。
数学直觉
如果用 x_0 表示原图,x_T 表示纯噪声,模型学到的就是反向条件概率(每一步预测噪声均值 μ 和协方差 Σ):
p_θ(x_{t-1} | x_t) = N(x_{t-1}; μ_θ(x_t, t), Σ_θ(x_t, t))
训练目标是预测每一步添加的噪声 ε,损失函数:
L = E[ ||ε - ε_θ(x_t, t)||² ]
主流扩散模型
| 模型 | 公司 | 特点 |
|---|---|---|
| Stable Diffusion 3 | Stability AI | 开源、文生图王者 |
| DALL·E 3 | OpenAI | 文字渲染优秀 |
| Imagen 3 | 写实风格 | |
| Midjourney V7 | Midjourney | 艺术风格 |
| Sora | OpenAI | 视频生成、60s 长视频 |
| 可灵 / 通义万相 | 快手 / 阿里 | 国产视频生成 |
唯元智创中的扩散模型
唯元智创平台已接入国产开源扩散模型(如 Stable Diffusion 3 中文微调版、智谱 CogView),通过统一 API 调用,文生图 0.008 元/张起,支持 LoRA 风格定制。
常见问题
扩散模型和 GAN 哪个更好?
扩散模型训练更稳定、生成质量更高、模式覆盖更全(多样性更好);GAN 推理更快但容易模式崩溃(Mode Collapse)。
扩散模型能生成视频吗?
可以。把 3D U-Net 换成时空 Transformer,就能在潜空间同时去噪时间和空间维度,这就是 Sora、可灵的核心思路。