[控场AI]
概念Diffusion Model / 扩散架构

扩散模型

扩散模型是一种基于概率的生成式机器学习模型架构,其核心思想是通过逐步向数据添加噪声(正向过程)再学习逐步去噪还原数据(反向过程)来建模数据分布。该模型最初广泛应用于图像生成领域,后逐步扩展至音频、视频及文本等多种模态的生成任务,具有生成质量高、多样性强的特点。

核心事实

时间轴 (近 90 天)

8月25日

DALL·E 2/3等传统图像生成流水线通常采用文本编码器加扩散模型的级联架构,文本先由CLIP等模型编码为向量再由扩散模型解码为图像

待验证50%
8月24日

扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量

待验证50%
8月23日

Midjourney是基于扩散模型(Diffusion Model)的图像生成工具

待验证50%
8月23日

扩散模型每次从随机噪声开始去噪,相同文本提示下不同随机种子会导致面部特征、体型、服装等漂移,是角色一致性困难的技术根源

待验证50%
8月23日

扩散模型在去噪过程中会将负面提示词对应的语义向量作为反向引导信号,这种机制被称为Classifier-Free Guidance的负向条件

待验证50%
8月22日

扩散模型在生成时会倾向于模式坍缩(mode collapse),即在缺乏具体约束时输出分布集中在训练数据中出现频率最高的视觉模式上

待验证50%
8月22日

大多数扩散模型对提示词中靠前位置的描述赋予更高的权重,因此将最重要的视觉元素放在提示词开头是有效的实践技巧

待验证50%
8月22日

扩散模型可通过引导(Guidance)机制实现可控生成,类似图像扩散中的Classifier-Free Guidance,无需重新训练模型

待验证50%
8月22日

同一AI工具很难同时做好灵感探索和精确执行,因为随机性与可控性在技术上处于张力关系

待验证50%
8月22日

在扩散模型中,较高的CFG(Classifier-Free Guidance)值会让输出更贴近提示词但更保守,较低的值给模型更多自由发挥空间

待验证50%

还有 7 条时间轴事件

全部知识事实 (17)

已验证

扩散模型的核心原理分为前向扩散过程(逐步添加高斯噪声)和反向去噪过程(从噪声中还原图像)两个阶段

90%
已验证

扩散模型在推理阶段从随机高斯噪声出发,经数十至数百步迭代去噪得到输出,即便固定随机种子,提示词的细微差异也会导致人脸特征、服装细节的显著偏移

65%
已验证

与GANs相比,扩散模型训练更稳定、生成多样性更高、更易与文本条件整合

65%
已验证

AI图像生成模型处理文字时表现不佳的根本原因在于扩散模型学习的是像素级视觉分布,而文字具有严格的符号逻辑

65%
待验证

在扩散模型中,较高的CFG(Classifier-Free Guidance)值会让输出更贴近提示词但更保守,较低的值给模型更多自由发挥空间

50%
待验证

同一AI工具很难同时做好灵感探索和精确执行,因为随机性与可控性在技术上处于张力关系

50%
待验证

扩散模型可通过引导(Guidance)机制实现可控生成,类似图像扩散中的Classifier-Free Guidance,无需重新训练模型

50%
待验证

扩散模型在生成时会倾向于模式坍缩(mode collapse),即在缺乏具体约束时输出分布集中在训练数据中出现频率最高的视觉模式上

50%
待验证

大多数扩散模型对提示词中靠前位置的描述赋予更高的权重,因此将最重要的视觉元素放在提示词开头是有效的实践技巧

50%
待验证

扩散模型在去噪过程中会将负面提示词对应的语义向量作为反向引导信号,这种机制被称为Classifier-Free Guidance的负向条件

50%
待验证

Midjourney是基于扩散模型(Diffusion Model)的图像生成工具

50%
待验证

扩散模型每次从随机噪声开始去噪,相同文本提示下不同随机种子会导致面部特征、体型、服装等漂移,是角色一致性困难的技术根源

50%
待验证

扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量

50%
待验证

DALL·E 2/3等传统图像生成流水线通常采用文本编码器加扩散模型的级联架构,文本先由CLIP等模型编码为向量再由扩散模型解码为图像

50%
待验证

扩散模型的推理是迭代去噪过程,通常需要数十甚至数百个时间步,对数值误差格外敏感

50%
待验证

图像生成模型通常采用CLIP或类似跨模态编码器将文本映射为高维向量,再由U-Net或DiT架构在潜空间逐步去噪生成图像

50%
待验证

Midjourney V3基于扩散模型(Diffusion Model)生成图像

50%

来源文章