扩散模型
扩散模型是一种基于概率的生成式机器学习模型架构,其核心思想是通过逐步向数据添加噪声(正向过程)再学习逐步去噪还原数据(反向过程)来建模数据分布。该模型最初广泛应用于图像生成领域,后逐步扩展至音频、视频及文本等多种模态的生成任务,具有生成质量高、多样性强的特点。
核心事实
时间轴 (近 90 天)
DALL·E 2/3等传统图像生成流水线通常采用文本编码器加扩散模型的级联架构,文本先由CLIP等模型编码为向量再由扩散模型解码为图像
扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量
Midjourney是基于扩散模型(Diffusion Model)的图像生成工具
扩散模型每次从随机噪声开始去噪,相同文本提示下不同随机种子会导致面部特征、体型、服装等漂移,是角色一致性困难的技术根源
扩散模型在去噪过程中会将负面提示词对应的语义向量作为反向引导信号,这种机制被称为Classifier-Free Guidance的负向条件
扩散模型在生成时会倾向于模式坍缩(mode collapse),即在缺乏具体约束时输出分布集中在训练数据中出现频率最高的视觉模式上
大多数扩散模型对提示词中靠前位置的描述赋予更高的权重,因此将最重要的视觉元素放在提示词开头是有效的实践技巧
扩散模型可通过引导(Guidance)机制实现可控生成,类似图像扩散中的Classifier-Free Guidance,无需重新训练模型
同一AI工具很难同时做好灵感探索和精确执行,因为随机性与可控性在技术上处于张力关系
在扩散模型中,较高的CFG(Classifier-Free Guidance)值会让输出更贴近提示词但更保守,较低的值给模型更多自由发挥空间
还有 7 条时间轴事件
全部知识事实 (17)
扩散模型的核心原理分为前向扩散过程(逐步添加高斯噪声)和反向去噪过程(从噪声中还原图像)两个阶段
90%已验证扩散模型在推理阶段从随机高斯噪声出发,经数十至数百步迭代去噪得到输出,即便固定随机种子,提示词的细微差异也会导致人脸特征、服装细节的显著偏移
65%已验证与GANs相比,扩散模型训练更稳定、生成多样性更高、更易与文本条件整合
65%已验证AI图像生成模型处理文字时表现不佳的根本原因在于扩散模型学习的是像素级视觉分布,而文字具有严格的符号逻辑
65%待验证在扩散模型中,较高的CFG(Classifier-Free Guidance)值会让输出更贴近提示词但更保守,较低的值给模型更多自由发挥空间
50%待验证同一AI工具很难同时做好灵感探索和精确执行,因为随机性与可控性在技术上处于张力关系
50%待验证扩散模型可通过引导(Guidance)机制实现可控生成,类似图像扩散中的Classifier-Free Guidance,无需重新训练模型
50%待验证扩散模型在生成时会倾向于模式坍缩(mode collapse),即在缺乏具体约束时输出分布集中在训练数据中出现频率最高的视觉模式上
50%待验证大多数扩散模型对提示词中靠前位置的描述赋予更高的权重,因此将最重要的视觉元素放在提示词开头是有效的实践技巧
50%待验证扩散模型在去噪过程中会将负面提示词对应的语义向量作为反向引导信号,这种机制被称为Classifier-Free Guidance的负向条件
50%待验证Midjourney是基于扩散模型(Diffusion Model)的图像生成工具
50%待验证扩散模型每次从随机噪声开始去噪,相同文本提示下不同随机种子会导致面部特征、体型、服装等漂移,是角色一致性困难的技术根源
50%待验证扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量
50%待验证DALL·E 2/3等传统图像生成流水线通常采用文本编码器加扩散模型的级联架构,文本先由CLIP等模型编码为向量再由扩散模型解码为图像
50%待验证扩散模型的推理是迭代去噪过程,通常需要数十甚至数百个时间步,对数值误差格外敏感
50%待验证图像生成模型通常采用CLIP或类似跨模态编码器将文本映射为高维向量,再由U-Net或DiT架构在潜空间逐步去噪生成图像
50%待验证Midjourney V3基于扩散模型(Diffusion Model)生成图像
50%