待验证50% 置信事实精确时间
深度递归指对单一输入快照的同一状态执行多轮迭代计算,Universal Transformer、DEQ等架构是代表
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证The Transformer architecture uses a Self-Attention mechanism to achieve efficient parallel processing of sequential data, replacing RNN/LSTM architectures.70% 相似待验证相比RNN/LSTM架构,Transformer支持大规模并行计算69% 相似待验证Llama.cpp 的 -ngl 参数控制将多少 Transformer 层放到 GPU 显存中运行,若显存不足会自动将放不下的层回退到 CPU 形成混合推理模式66% 相似待验证Unsloth使用Triton语言编写了自定义GPU算子,针对Transformer架构中的注意力计算、矩阵乘法等核心操作进行了深度优化66% 相似待验证上下文缓存技术底层依赖Transformer的KV Cache机制,前缀相同的Key和Value向量可复用66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/507155API
curl https://kongchang.com/api/v1/knowledge/claims/507155MCP
get_claim(id=507155)