扩散模型
扩散模型是一种基于概率的生成式机器学习模型架构,其核心思想是通过逐步向数据添加噪声(正向过程)再学习逐步去噪还原数据(反向过程)来建模数据分布。该模型最初广泛应用于图像生成领域,后逐步扩展至音频、视频及文本等多种模态的生成任务,具有生成质量高、多样性强的特点。
核心事实
时间轴 (近 90 天)
AI扩散模型生成图像的像素分布来自对训练数据的概率采样
用语言模型输出代码做渲染的思路比直接调用图像模型更可控、成本更低,且不存在扩散模型常见的幻觉性视觉错误
扩散模型和流匹配通过训练神经网络将采样成本一次性消化在训练中,推理时只需前向传播
研究者借助扩散模型(Diffusion Model)等图像生成架构显著提升了脑扫描图像重建质量
四步加速方案通过蒸馏技术训练出能在4步内完成的模型版本,相比标准约50步的采样流程速度大幅提升但画质损失比量化更明显
扩散模型相关论文数量在2022年后爆炸式增长
姿态控制模型的核心思路是从参考素材提取逐帧骨骼姿态信息作为条件输入扩散模型,驱动目标人物按相同姿态运动同时保留其外貌特征
保持同一对话上下文、不更换模型版本、固定随机种子是维持角色一致性的辅助手段
马尔可夫链及其变体作为概率推断的基础工具持续活跃,并在扩散模型的理论分析中再度获得关注
主流扩散模型通常在较低的潜空间分辨率下生成图像,再通过上采样还原到目标尺寸
还有 40 条时间轴事件
全部知识事实 (20)
扩散模型的核心原理分为前向扩散过程(逐步添加高斯噪声)和反向去噪过程(从噪声中还原图像)两个阶段
90%已验证Stable Diffusion基于潜在扩散模型(Latent Diffusion Model),通过在压缩的潜在空间中进行去噪过程来生成高质量图像
90%已验证扩散模型相比GAN训练更稳定、生成多样性更强,且不易出现模式崩溃问题
90%已验证扩散模型受非平衡热力学启发,采用两步训练过程:前向过程逐渐向图像添加高斯噪声直至纯随机噪声,反向过程训练神经网络从纯噪声逐步去噪还原为清晰图像
80%已验证文本指令通过CLIP等跨模态编码器转化为语义向量,将文字和图像嵌入同一语义空间以引导图像生成
80%已验证GAN通过生成器与判别器对抗博弈提升生成质量,但容易出现模式崩溃问题;扩散模型训练目标更稳定,天然避免模式崩溃
80%已验证当前主流的文生视频模型普遍基于扩散模型架构,通过在时间维度上扩展图像生成能力来产生连贯的视频帧序列
80%已验证图像生成模型的输出随机性本质上来源于扩散过程的初始噪声采样,Seed(随机数种子)控制初始噪声
80%已验证扩散模型的去噪过程基于DDPM原理,训练时向数据逐步添加高斯噪声,再训练神经网络学习逆向去噪
80%已验证DDPM(Denoising Diffusion Probabilistic Models)在2020年奠定了扩散模型的理论基础
80%已验证当前主流 AI 图像生成模型大多基于扩散模型(Diffusion Model)架构
80%已验证AI视频生成技术经历了从GAN(生成对抗网络)到扩散模型(Diffusion Model)的范式转变
80%已验证扩散模型通过在海量图像数据上训练,学会了从随机噪声中逐步去噪生成图像的能力
80%已验证与GANs相比,扩散模型训练更稳定、生成多样性更高、更易与文本条件整合
80%已验证Qwen的图像生成能力基于扩散模型(Diffusion Model)技术
80%已验证2015年Sohl-Dickstein等人首次将扩散过程引入生成模型
75%已验证图像生成模型通常采用CLIP或类似跨模态编码器将文本映射为高维向量,再由U-Net或DiT架构在潜空间逐步去噪生成图像
75%已验证扩散模型通过逐步去噪从随机噪声中还原目标图像或视频帧,通常需要数十步去噪迭代,计算开销极大
75%已验证标准扩散模型往往需要20-50步生成
75%已验证当前主流AI 3D生成工具在底层技术路线上大致分为多视角扩散模型和直接预测3D网格的端到端模型两类
70%