[控场AI]
模型SD

Stable Diffusion

Stable Diffusion是由Stability AI主导开发并开源的文本到图像生成模型,基于潜在扩散模型(Latent Diffusion Model)架构。该模型能够根据文本提示词生成高质量图像,支持图生图、图像修复等多种任务,具有可本地部署、资源占用相对较低的特点,是目前社区生态最为活跃的开源图像生成模型之一。

核心事实

时间轴 (近 90 天)

9月12日

LoRA已成为Stable Diffusion、Flux乃至Krea等图像生成生态中最主流的微调方式

待验证50%
9月12日

Unsloth Desktop 支持图像/视频扩散模型,覆盖Stable Diffusion等生成式模型

待验证50%
9月12日

借助Midjourney、Stable Diffusion、Flux等主流图像生成模型,创作者可以在几分钟内根据社区反馈生成角色的不同形态

待验证50%
9月11日

许多图像编辑模型是在预训练图像生成模型(如Stable Diffusion架构)基础上通过指令微调叠加编辑能力

待验证50%
9月11日

文章介绍的AIGC创作平台整合了GPT-4.0、Stable Diffusion、Luma Dream Machine等AI模型

待验证50%
9月11日

Midjourney、Stable Diffusion等模型在训练数据合规性上面临法律诉讼

待验证50%
9月11日

开源、本地化的AI工具正在快速蚕食商业闭源服务的领地,如Stable Diffusion之于图像生成

待验证50%
9月11日

标准SD模型的CFG通常设置在7左右

待验证50%
9月11日

Stability AI在发布Stable Diffusion时选择完全开源

待验证50%
9月11日

Getty Images起诉Stability AI,指控其Stable Diffusion图像生成模型侵犯了数百万张图片的版权

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

Midjourney、Stable Diffusion、DALL-E属于当前主流AI图像生成工具

90%
已验证

Stable Diffusion基于潜在扩散模型(Latent Diffusion Model),通过在压缩的潜在空间中进行去噪过程来生成高质量图像

90%
已验证

Stability AI因开源图像生成模型Stable Diffusion而声名鹊起

90%
已验证

Stable Diffusion是开源模型,可以本地部署,支持LoRA微调、ControlNet精确控制等高级功能

80%
已验证

DDPM(Denoising Diffusion Probabilistic Models)在2020年奠定了扩散模型的理论基础

80%
已验证

Latent Diffusion通过VAE将图像从512×512×3的像素空间压缩到64×64×4的潜空间表示,数据量缩减约48倍

80%
已验证

Stable Diffusion于2022年开源

80%
已验证

ComfyUI是一个基于节点式工作流的Stable Diffusion图形界面工具,用户可以通过拖拽和连接不同功能节点来构建自定义的图像处理流程

80%
已验证

扩散模型通过在海量图像数据上训练,学会了从随机噪声中逐步去噪生成图像的能力

80%
已验证

潜在扩散模型通过在低维潜在空间而非像素空间执行扩散过程,大幅降低了计算成本

75%
已验证

Stable Diffusion将扩散过程从像素空间压缩至潜在空间,由变分自编码器(VAE)实现

75%
已验证

生成式AI模型基于Transformer架构,在代码理解和生成方面展现出显著能力

75%
已验证

扩散模型成为Stable Diffusion、DALL-E 3等主流工具的底层架构

70%
已验证

Stable Diffusion的Checkpoint模型通常为2-7GB,LoRA模型通常只有几十到几百MB

70%
已验证

ComfyUI是开源图形化工作流工具,其核心设计理念是将生成管线拆解为可视化的节点图

65%
已验证

扩散模型以 DALL-E 2、Stable Diffusion、Midjourney 为代表,重新定义了图像生成任务

65%
已验证

ComfyUI是由稳定扩散社区开发的开源图形化工作流工具,其设计源自数据流编程范式

65%
已验证

扩散模型通过逐步添加高斯噪声再训练模型学习逆向去噪的马尔可夫链机制,规避了对抗训练的不稳定性

65%
已验证

主流扩散模型(Diffusion Model)代表性产品包括Stable Diffusion、DALL-E 2早期版本、Midjourney,其工作原理是在训练阶段向图像逐步添加高斯噪声,再训练神经网络学习去噪的逆过程

65%
已验证

4GB显存可以生成512×512分辨率的图像,8GB以上显存能支持更高分辨率和更复杂的工作流

65%

来源文章