扩散模型
扩散模型是一种基于概率的生成式机器学习模型架构,其核心思想是通过逐步向数据添加噪声(正向过程)再学习逐步去噪还原数据(反向过程)来建模数据分布。该模型最初广泛应用于图像生成领域,后逐步扩展至音频、视频及文本等多种模态的生成任务,具有生成质量高、多样性强的特点。
Core Facts
Timeline (last 90 days)
扩散模型生成的视频对输出的精确控制极为有限,同一段提示词每次运行结果都不同
程序化生成与扩散模型是在可控性与表现力之间做出不同权衡的两种范式
图像水印通常在扩散模型的潜空间(latent space)或最终像素层注入人眼不可分辨的噪声模式
arXiv论文(arXiv:2610.02663)系统研究了基于分数匹配的扩散模型/流匹配模型在本质低维数据上的泛化性质
AI扩散模型生成图像的像素分布来自对训练数据的概率采样
用语言模型输出代码做渲染的思路比直接调用图像模型更可控、成本更低,且不存在扩散模型常见的幻觉性视觉错误
扩散模型和流匹配通过训练神经网络将采样成本一次性消化在训练中,推理时只需前向传播
研究者借助扩散模型(Diffusion Model)等图像生成架构显著提升了脑扫描图像重建质量
四步加速方案通过蒸馏技术训练出能在4步内完成的模型版本,相比标准约50步的采样流程速度大幅提升但画质损失比量化更明显
扩散模型相关论文数量在2022年后爆炸式增长
40 more timeline events
All Facts (20)
扩散模型的核心原理分为前向扩散过程(逐步添加高斯噪声)和反向去噪过程(从噪声中还原图像)两个阶段
90%VerifiedStable Diffusion基于潜在扩散模型(Latent Diffusion Model),通过在压缩的潜在空间中进行去噪过程来生成高质量图像
90%Verified扩散模型相比GAN训练更稳定、生成多样性更强,且不易出现模式崩溃问题
90%Verified扩散模型受非平衡热力学启发,采用两步训练过程:前向过程逐渐向图像添加高斯噪声直至纯随机噪声,反向过程训练神经网络从纯噪声逐步去噪还原为清晰图像
80%Verified文本指令通过CLIP等跨模态编码器转化为语义向量,将文字和图像嵌入同一语义空间以引导图像生成
80%VerifiedGAN通过生成器与判别器对抗博弈提升生成质量,但容易出现模式崩溃问题;扩散模型训练目标更稳定,天然避免模式崩溃
80%Verified当前主流的文生视频模型普遍基于扩散模型架构,通过在时间维度上扩展图像生成能力来产生连贯的视频帧序列
80%Verified图像生成模型的输出随机性本质上来源于扩散过程的初始噪声采样,Seed(随机数种子)控制初始噪声
80%Verified扩散模型的去噪过程基于DDPM原理,训练时向数据逐步添加高斯噪声,再训练神经网络学习逆向去噪
80%VerifiedDDPM(Denoising Diffusion Probabilistic Models)在2020年奠定了扩散模型的理论基础
80%Verified当前主流 AI 图像生成模型大多基于扩散模型(Diffusion Model)架构
80%VerifiedAI视频生成技术经历了从GAN(生成对抗网络)到扩散模型(Diffusion Model)的范式转变
80%Verified扩散模型通过在海量图像数据上训练,学会了从随机噪声中逐步去噪生成图像的能力
80%Verified与GANs相比,扩散模型训练更稳定、生成多样性更高、更易与文本条件整合
80%VerifiedQwen的图像生成能力基于扩散模型(Diffusion Model)技术
80%Verified传统视频生成依赖扩散模型技术,通过逐步去噪的方式从随机噪声中生成图像或视频帧,每一帧生成都需要经历数十到上百步的迭代计算
75%Verified2015年Sohl-Dickstein等人首次将扩散过程引入生成模型
75%Verified图像生成模型通常采用CLIP或类似跨模态编码器将文本映射为高维向量,再由U-Net或DiT架构在潜空间逐步去噪生成图像
75%Verified扩散模型通过逐步去噪从随机噪声中还原目标图像或视频帧,通常需要数十步去噪迭代,计算开销极大
75%Verified标准扩散模型往往需要20-50步生成
75%