待验证50% 置信事实精确时间
GPU并行归约操作的浮点累加顺序不固定导致传统Transformer注意力机制的实际输出存在微小的不可复现波动
1
来源数
50%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
待验证Transformer 架构中自注意力层会为每个 Token 生成对应的 Key 和 Value 向量并缓存在 GPU 显存中,即 KV Cache 机制,上下文越长占用显存越大,推理成本呈近线性增长78% 相似已验证Transformer的注意力机制缺乏随时间动态迭代的误差修正循环,这是其与生物注意力机制的根本分野77% 相似待验证麻省理工学院研究发现Transformer注意力机制处理少样本示例时行为模式与梯度下降优化器相似75% 相似已验证标准 Transformer 的 Self-Attention 机制需要对整个输入序列做全局计算,天然不适合边输入边处理的流式场景74% 相似待验证Transformer的自注意力机制天然是无记忆的,每次推理从零开始,仅依赖当前输入的上下文窗口74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/573237API
curl https://kongchang.com/api/v1/knowledge/claims/573237MCP
get_claim(id=573237)