Stable Diffusion是由Stability AI主导开发并开源的文本到图像生成模型,基于潜在扩散模型(Latent Diffusion Model)架构。该模型能够根据文本提示词生成高质量图像,支持图生图、图像修复等多种任务,具有可本地部署、资源占用相对较低的特点,是目前社区生态最为活跃的开源图像生成模型之一。
Midjourney、Stable Diffusion和DALL-E 3可用于快速生成游戏概念图和角色设计稿
Stable Diffusion 模型由变分自编码器(VAE)、U-Net 架构的噪声预测网络和基于 CLIP 的文本编码器三个关键组件构成
AnimateDiff由上海AI实验室于2023年提出,通过在Stable Diffusion的UNet架构中插入可训练的时间注意力层并冻结原始空间层权重来实现运动建模
ComfyUI 是一个基于节点的 Stable Diffusion 图形用户界面,采用数据流编程范式,将生成流程拆解为有向无环图(DAG)
Stable Diffusion的模型权重、代码和训练细节全部公开
AUTOMATIC1111 WebUI成为了Stable Diffusion最主要的使用入口
VAE通常压缩比为8×8(空间维度缩小64倍),源自Stable Diffusion的Latent Diffusion Model(LDM)框架
通过修改ComfyUI配置文件的base_path参数,可以让ComfyUI与Stable Diffusion共享同一模型文件夹以避免重复占用存储
能在一周内突破10万GitHub星标的项目屈指可数,历史上只有Meta的Llama系列、Stable Diffusion等少数现象级项目达到过这个高度
Stable Diffusion采用潜在扩散模型(Latent Diffusion Model),在压缩的潜在空间而非像素空间进行扩散
40 more timeline events
Midjourney、Stable Diffusion、DALL-E属于当前主流AI图像生成工具
90%VerifiedStable Diffusion基于潜在扩散模型(Latent Diffusion Model),通过在压缩的潜在空间中进行去噪过程来生成高质量图像
90%VerifiedStability AI因开源图像生成模型Stable Diffusion而声名鹊起
90%VerifiedStable Diffusion是开源模型,可以本地部署,支持LoRA微调、ControlNet精确控制等高级功能
80%VerifiedDDPM(Denoising Diffusion Probabilistic Models)在2020年奠定了扩散模型的理论基础
80%VerifiedLatent Diffusion通过VAE将图像从512×512×3的像素空间压缩到64×64×4的潜空间表示,数据量缩减约48倍
80%VerifiedStable Diffusion于2022年开源
80%VerifiedComfyUI是一个基于节点式工作流的Stable Diffusion图形界面工具,用户可以通过拖拽和连接不同功能节点来构建自定义的图像处理流程
80%Verified扩散模型通过在海量图像数据上训练,学会了从随机噪声中逐步去噪生成图像的能力
80%Verified潜在扩散模型通过在低维潜在空间而非像素空间执行扩散过程,大幅降低了计算成本
75%VerifiedStable Diffusion将扩散过程从像素空间压缩至潜在空间,由变分自编码器(VAE)实现
75%Verified生成式AI模型基于Transformer架构,在代码理解和生成方面展现出显著能力
75%Verified扩散模型成为Stable Diffusion、DALL-E 3等主流工具的底层架构
70%VerifiedStable Diffusion的Checkpoint模型通常为2-7GB,LoRA模型通常只有几十到几百MB
70%VerifiedComfyUI是开源图形化工作流工具,其核心设计理念是将生成管线拆解为可视化的节点图
65%Verified扩散模型以 DALL-E 2、Stable Diffusion、Midjourney 为代表,重新定义了图像生成任务
65%VerifiedComfyUI是由稳定扩散社区开发的开源图形化工作流工具,其设计源自数据流编程范式
65%Verified主流扩散模型(Diffusion Model)代表性产品包括Stable Diffusion、DALL-E 2早期版本、Midjourney,其工作原理是在训练阶段向图像逐步添加高斯噪声,再训练神经网络学习去噪的逆过程
65%Verified4GB显存可以生成512×512分辨率的图像,8GB以上显存能支持更高分辨率和更复杂的工作流
65%VerifiedStable Diffusion社区生态以Civitai和Hugging Face为核心平台,截至2024年已积累超过10万个社区微调模型
65%