待验证50% 置信事实精确时间
扩散语言模型的Transformer通常采用双向注意力,需接收时间步信息(通过正弦编码或AdaLN注入),因此标准预训练语言模型权重不能直接复用
1
来源数
50%
置信度
长期有效
时效性
2026/9/1
首次发现
来源
涉及实体
相关事实
待验证Context forgetting in AI coding tools is a fundamental limitation of Transformer-based large language models, not a flaw specific to any one model71% 相似已验证大语言模型本质上是无状态的,不存在跨会话的原生记忆机制,这根植于Transformer架构本身68% 相似待验证主流扩散模型的文字生成依赖CLIP等视觉-语言预训练模型,其训练数据以英文为主,导致中文字符生成困难67% 相似待验证当前几乎所有主流大语言模型都基于Transformer架构67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/837836API
curl https://kongchang.com/api/v1/knowledge/claims/837836MCP
get_claim(id=837836)