Stable Diffusion
Stable Diffusion是由Stability AI主导开发并开源的文本到图像生成模型,基于潜在扩散模型(Latent Diffusion Model)架构。该模型能够根据文本提示词生成高质量图像,支持图生图、图像修复等多种任务,具有可本地部署、资源占用相对较低的特点,是目前社区生态最为活跃的开源图像生成模型之一。
核心事实
时间轴 (近 90 天)
LoRA已成为Stable Diffusion、Flux乃至Krea等图像生成生态中最主流的微调方式
Unsloth Desktop 支持图像/视频扩散模型,覆盖Stable Diffusion等生成式模型
借助Midjourney、Stable Diffusion、Flux等主流图像生成模型,创作者可以在几分钟内根据社区反馈生成角色的不同形态
许多图像编辑模型是在预训练图像生成模型(如Stable Diffusion架构)基础上通过指令微调叠加编辑能力
文章介绍的AIGC创作平台整合了GPT-4.0、Stable Diffusion、Luma Dream Machine等AI模型
Midjourney、Stable Diffusion等模型在训练数据合规性上面临法律诉讼
开源、本地化的AI工具正在快速蚕食商业闭源服务的领地,如Stable Diffusion之于图像生成
标准SD模型的CFG通常设置在7左右
Stability AI在发布Stable Diffusion时选择完全开源
Getty Images起诉Stability AI,指控其Stable Diffusion图像生成模型侵犯了数百万张图片的版权
还有 40 条时间轴事件
全部知识事实 (20)
Midjourney、Stable Diffusion、DALL-E属于当前主流AI图像生成工具
90%已验证Stable Diffusion基于潜在扩散模型(Latent Diffusion Model),通过在压缩的潜在空间中进行去噪过程来生成高质量图像
90%已验证Stability AI因开源图像生成模型Stable Diffusion而声名鹊起
90%已验证Stable Diffusion是开源模型,可以本地部署,支持LoRA微调、ControlNet精确控制等高级功能
80%已验证DDPM(Denoising Diffusion Probabilistic Models)在2020年奠定了扩散模型的理论基础
80%已验证Latent Diffusion通过VAE将图像从512×512×3的像素空间压缩到64×64×4的潜空间表示,数据量缩减约48倍
80%已验证Stable Diffusion于2022年开源
80%已验证ComfyUI是一个基于节点式工作流的Stable Diffusion图形界面工具,用户可以通过拖拽和连接不同功能节点来构建自定义的图像处理流程
80%已验证扩散模型通过在海量图像数据上训练,学会了从随机噪声中逐步去噪生成图像的能力
80%已验证潜在扩散模型通过在低维潜在空间而非像素空间执行扩散过程,大幅降低了计算成本
75%已验证Stable Diffusion将扩散过程从像素空间压缩至潜在空间,由变分自编码器(VAE)实现
75%已验证生成式AI模型基于Transformer架构,在代码理解和生成方面展现出显著能力
75%已验证扩散模型成为Stable Diffusion、DALL-E 3等主流工具的底层架构
70%已验证Stable Diffusion的Checkpoint模型通常为2-7GB,LoRA模型通常只有几十到几百MB
70%已验证ComfyUI是开源图形化工作流工具,其核心设计理念是将生成管线拆解为可视化的节点图
65%已验证扩散模型以 DALL-E 2、Stable Diffusion、Midjourney 为代表,重新定义了图像生成任务
65%已验证ComfyUI是由稳定扩散社区开发的开源图形化工作流工具,其设计源自数据流编程范式
65%已验证扩散模型通过逐步添加高斯噪声再训练模型学习逆向去噪的马尔可夫链机制,规避了对抗训练的不稳定性
65%已验证主流扩散模型(Diffusion Model)代表性产品包括Stable Diffusion、DALL-E 2早期版本、Midjourney,其工作原理是在训练阶段向图像逐步添加高斯噪声,再训练神经网络学习去噪的逆过程
65%已验证4GB显存可以生成512×512分辨率的图像,8GB以上显存能支持更高分辨率和更复杂的工作流
65%