待验证60% 置信事实时间未知
早期扩散模型如Stable Diffusion和DALL-E 2生成的图片中文字往往呈现乱码或模糊状态
2
来源数
60%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
GPT-5.2、Claude 4.5、Gemini 3 Pro实测对比:2025选购指南
bilibiliAI技术研究院
涉及实体
相关事实
已验证扩散模型以 DALL-E 2、Stable Diffusion、Midjourney 为代表,重新定义了图像生成任务77% 相似待验证扩散模型(如Stable Diffusion)通过逐步去噪还原图像,擅长细节纹理;自回归多模态模型(如GPT Image 2)在理解复杂文字指令和保持角色一致性方面更具优势76% 相似已验证Stable Diffusion基于潜在扩散模型(Latent Diffusion Model),通过在压缩的潜在空间中进行去噪过程来生成高质量图像72% 相似已验证当前主流扩散模型的图像生成是从随机噪声经多步去噪还原的不可逆过程,模型不保留像素与语义元素的显式映射,导致无法进行局部修改只能整张重新生成72% 相似待验证DALL·E 2和Stable Diffusion均基于扩散模型原理72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/20610API
curl https://kongchang.com/api/v1/knowledge/claims/20610MCP
get_claim(id=20610)