Unverified50% confidenceFactExact time
Checkpoint是预训练的扩散模型权重文件通常2-7GB,VAE负责像素空间和潜空间之间转换图像,CFG Scale控制生成图像对文本提示词的遵循程度
1
Sources
50%
Confidence
Long-term
Relevance
8/26/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在图像生成中LoRA主要作用于U-Net或DiT架构中自注意力与交叉注意力层的Q、K、V投影矩阵,使RTX 3090(24GB显存)等消费级显卡也能完成模型定制训练65% similarUnverified图生视频中条件图像通常通过VAE编码为潜空间表示,然后与噪声序列拼接或通过交叉注意力注入生成过程64% similarUnverified掩码自编码器(MAE)通过随机遮盖图像块后让模型重建,可用于雷达图像的自监督预训练63% similarUnverified基于扩散模型和生成对抗网络的图像处理技术通常需要海量真实用户图像作为训练数据62% similarUnverified图像条件化方案通常借助CLIP视觉编码器(ViT架构)将参考图映射到与文本嵌入共享的语义空间,再通过交叉注意力(Cross-Attention)机制将视觉特征注入UNet的去噪过程61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/805283API
curl https://kongchang.com/api/v1/knowledge/claims/805283MCP
get_claim(id=805283)