SDXL(Stable Diffusion XL)是由Stability AI发布的大规模文本到图像生成模型,是Stable Diffusion系列的升级版本。采用双文本编码器架构,具有更大的模型参数规模,能够生成更高分辨率、细节更丰富的图像,并对复杂提示词具有更强的语义理解与表达能力,广泛应用于AI艺术创作、设计辅助等领域。
对于追求速度与质量平衡且不追求极致的定位,SDXL及其衍生模型是最契合的选择
SDXL通常25-35步即可获得不错效果,盲目提高步数收益递减且拖慢速度
Realistic Vision XL和Juggernaut XL是基于SDXL微调的社区模型,在人体比例和皮肤质感方面表现较稳定
SDXL相比SD1.5采用双文本编码器架构,同时使用CLIP-ViT-L和OpenCLIP-ViT-bigG
SDXL系列因其更高的原生分辨率,在处理多人物场景时相比早期SD1.5模型有更大优势
相比全量微调,LoRA所需的显存和计算资源大幅减少,使个人创作者在消费级GPU上微调SDXL成为可能
LoRA(Low-Rank Adaptation)在图像生成加速中可作为蒸馏载体,将需20-50步的SDXL等多步扩散模型压缩成仅需4-8步的少步采样方案
一位创作者用自己童年的60张照片对SDXL模型进行微调,以生成式AI重现记忆
SDXL将U-Net参数量提升至35亿,采用双文本编码器(OpenCLIP ViT-bigG和CLIP ViT-L)以及两阶段生成架构(base + refiner)
Kohya_ss是日本开发者kohya-ss开发的专用训练框架,支持SDXL架构,是社区最主流的微调工具之一
8 more timeline events
4GB显存可以生成512×512分辨率的图像,8GB以上显存能支持更高分辨率和更复杂的工作流
65%Unverified2023-2024年间,图像生成领域经历了从Stable Diffusion 1.5到SDXL再到SD3的架构跃迁
60%UnverifiedSDXL通常25-35步即可获得不错效果,盲目提高步数收益递减且拖慢速度
50%Unverified对于追求速度与质量平衡且不追求极致的定位,SDXL及其衍生模型是最契合的选择
50%UnverifiedSDXL相比SD1.5采用双文本编码器架构,同时使用CLIP-ViT-L和OpenCLIP-ViT-bigG
50%UnverifiedRealistic Vision XL和Juggernaut XL是基于SDXL微调的社区模型,在人体比例和皮肤质感方面表现较稳定
50%UnverifiedSDXL系列因其更高的原生分辨率,在处理多人物场景时相比早期SD1.5模型有更大优势
50%Unverified相比全量微调,LoRA所需的显存和计算资源大幅减少,使个人创作者在消费级GPU上微调SDXL成为可能
50%UnverifiedLoRA(Low-Rank Adaptation)在图像生成加速中可作为蒸馏载体,将需20-50步的SDXL等多步扩散模型压缩成仅需4-8步的少步采样方案
50%UnverifiedKohya_ss是日本开发者kohya-ss开发的专用训练框架,支持SDXL架构,是社区最主流的微调工具之一
50%UnverifiedSDXL将U-Net参数量提升至35亿,采用双文本编码器(OpenCLIP ViT-bigG和CLIP ViT-L)以及两阶段生成架构(base + refiner)
50%UnverifiedSDXL的参数量从SD1.5的约0.9B增长到6.6B
50%Unverified一个为SDXL训练的LoRA无法直接用于SD1.5
50%Unverified早期的Stable Diffusion和DALL·E 2在概念绑定方面表现较差,而SDXL、DALL·E 3和Midjourney v5等模型通过引入更强文本编码器等策略显著提升了准确性
50%UnverifiedSDXL系列模型的最佳生成分辨率在总像素数约100万像素附近,9:16比例下推荐使用768×1344或832×1472等尺寸
50%UnverifiedZ-Image Turbo很可能基于SDXL或Flux等基础架构进行了针对性训练
50%UnverifiedSDXL采用1024×1024原生分辨率和双U-Net架构,相比SD 1.5的512×512原生分辨率有显著提升
50%Unverified一位创作者用自己童年的60张照片对SDXL模型进行微调,以生成式AI重现记忆
50%Unverified2023年底,AUTOMATIC1111发布了基于Stable Diffusion XL(SDXL)优化的新版本,支持原生1024×1024分辨率生成
50%