SDXL
SDXL(Stable Diffusion XL)是由Stability AI发布的大规模文本到图像生成模型,是Stable Diffusion系列的升级版本。采用双文本编码器架构,具有更大的模型参数规模,能够生成更高分辨率、细节更丰富的图像,并对复杂提示词具有更强的语义理解与表达能力,广泛应用于AI艺术创作、设计辅助等领域。
时间轴 (近 90 天)
SDXL 基础模型本身约占 6–7GB 显存,同时加载 Refiner、多个 ControlNet 权重(每个约 1.4GB)和高精度 VAE 时峰值显存容易超过 20GB
SD XL 引入了双编码器架构(CLIP ViT-L + OpenCLIP ViT-bigG),提升了长提示词的语义捕捉能力
据发布者描述,Nanosaur 2 在与 SDXL 模型的对比中很多时候能够胜出,尽管其参数量远小于 SDXL
Flux、SDXL 等后续模型在公开基准上的得分差距已相当有限
跑主流图像生成模型(如SDXL)至少需要8GB显存
CFG=4–4.5 是许多 Flux、SD3 系列模型的推荐起点区间,而 SDXL 类模型常用 5–8
SDXL约有6.6B参数
Prompt Studio 支持 Generic、FLUX、Krea 2、SDXL 等不同模型的提示语法定制化优化
SDXL通常25-35步即可获得不错效果,盲目提高步数收益递减且拖慢速度
对于追求速度与质量平衡且不追求极致的定位,SDXL及其衍生模型是最契合的选择
还有 16 条时间轴事件
全部知识事实 (20)
SDXL采用了双CLIP编码器(OpenCLIP ViT-bigG和OpenAI CLIP ViT-L)的设计
90%待验证sd-scripts支持LoRA、LyCORIS(LoHa、LoKr等)、Textual Inversion、DreamBooth等微调方法,并支持SD 1.5、SDXL和SD3
90%待验证SD1.5使用768维条件向量,SDXL使用1024维条件向量
85%待验证SD 1.5系列模型约需4-6G显存,SDXL系列通常需要8-12G显存
85%待验证2023-2024年间,图像生成领域经历了从Stable Diffusion 1.5到SDXL再到SD3的架构跃迁
60%待验证SDXL(Stable Diffusion XL)是Stability AI推出的高分辨率图像生成模型,其完整管线包含Base模型和Refiner模型两个阶段
60%待验证SDXL 基础模型本身约占 6–7GB 显存,同时加载 Refiner、多个 ControlNet 权重(每个约 1.4GB)和高精度 VAE 时峰值显存容易超过 20GB
50%待验证SD XL 引入了双编码器架构(CLIP ViT-L + OpenCLIP ViT-bigG),提升了长提示词的语义捕捉能力
50%待验证据发布者描述,Nanosaur 2 在与 SDXL 模型的对比中很多时候能够胜出,尽管其参数量远小于 SDXL
50%待验证Flux、SDXL 等后续模型在公开基准上的得分差距已相当有限
50%待验证跑主流图像生成模型(如SDXL)至少需要8GB显存
50%待验证CFG=4–4.5 是许多 Flux、SD3 系列模型的推荐起点区间,而 SDXL 类模型常用 5–8
50%待验证SDXL约有6.6B参数
50%待验证Prompt Studio 支持 Generic、FLUX、Krea 2、SDXL 等不同模型的提示语法定制化优化
50%待验证SDXL通常25-35步即可获得不错效果,盲目提高步数收益递减且拖慢速度
50%待验证对于追求速度与质量平衡且不追求极致的定位,SDXL及其衍生模型是最契合的选择
50%待验证SDXL相比SD1.5采用双文本编码器架构,同时使用CLIP-ViT-L和OpenCLIP-ViT-bigG
50%待验证SDXL系列因其更高的原生分辨率,在处理多人物场景时相比早期SD1.5模型有更大优势
50%待验证Realistic Vision XL和Juggernaut XL是基于SDXL微调的社区模型,在人体比例和皮肤质感方面表现较稳定
50%待验证相比全量微调,LoRA所需的显存和计算资源大幅减少,使个人创作者在消费级GPU上微调SDXL成为可能
50%