待验证50% 置信事实精确时间
潜在扩散模型将图像生成从像素空间转移到压缩后的潜在空间进行,包含编码器压缩图像、U-Net在潜在空间执行迭代去噪、解码器还原为像素图像三个关键组件
1
来源数
50%
置信度
长期有效
时效性
2026/8/27
首次发现
来源
涉及实体
相关事实
待验证在Midjourney所使用的扩散模型架构中,图像先在压缩的低维潜空间中完成逐步去噪,再通过解码器还原为完整图像80% 相似待验证现代 AI 视频生成模型基于变分自编码器将高维像素图像压缩至低维潜向量表示,在潜空间中寻找过渡路径而非像素级线性插值75% 相似待验证图像生成模型通常采用CLIP或类似跨模态编码器将文本映射为高维向量,再由U-Net或DiT架构在潜空间逐步去噪生成图像74% 相似待验证Image2将图像生成从独立的扩散模型(如DALL·E 3使用的级联扩散架构)迁移到了自回归式的token生成范式中72% 相似待验证基于扩散模型的数据增强利用Stable Diffusion等生成模型将合成渲染图像风格化为更接近真实照片的外观,同时保留原有几何标注信息71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/807864API
curl https://kongchang.com/api/v1/knowledge/claims/807864MCP
get_claim(id=807864)