待验证50% 置信事实精确时间
Transformer自回归生成分为Prefill阶段(计算密集型,GPU利用率较高)和Decode阶段(带宽密集型,逐token生成)
1
来源数
50%
置信度
长期有效
时效性
2026/9/6
首次发现
来源
涉及实体
相关事实
待验证DiffusionBlocks在五种不同架构上进行了验证:ViT、DiT、Masked Diffusion、自回归Transformer和循环深度Transformer72% 相似待验证Llama.cpp 的 -ngl 参数控制将多少 Transformer 层放到 GPU 显存中运行,若显存不足会自动将放不下的层回退到 CPU 形成混合推理模式72% 相似待验证TensorRT-LLM专门针对Transformer架构的自回归生成进行优化,支持KV缓存管理、in-flight batching和张量并行等特性71% 相似待验证Transformer架构的计算复杂度相对序列长度呈二次增长,但高度并行化的特性使其在GPU上的训练效率远超LSTM和GRU架构71% 相似待验证图像生成领域正在经历从U-Net到Transformer的架构范式转移,传统扩散模型如Stable Diffusion 1.x和2.x主要依赖U-Net编码器-解码器结构70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/867057API
curl https://kongchang.com/api/v1/knowledge/claims/867057MCP
get_claim(id=867057)