待验证50% 置信事实精确时间
2022年Google的《Switch Transformers》论文证明稀疏专家层可在几乎不增加计算量的前提下将模型容量扩展数倍
1
来源数
50%
置信度
长期有效
时效性
2026/7/21
首次发现
来源
相关事实
待验证标准Transformer自注意力计算量随序列长度平方增长,50万token的注意力计算量约为4096token的15000倍62% 相似待验证Transformer注意力机制的计算量随序列长度平方增长,早期语言模型上下文窗口上限约4000个token62% 相似待验证在发布基准测试中,vLLM相比HuggingFace Transformers原生推理实现了高达24倍的吞吐提升62% 相似待验证Transformer推理中批量大小为1时注意力层的算术强度约1~10 FLOP/Byte,远低于H100约300 FLOP/Byte的屋脊点,属于带宽受限场景61% 相似待验证MTP的额外预测头直接复用Transformer的隐藏状态表示,因此额外的计算开销极小60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/579710API
curl https://kongchang.com/api/v1/knowledge/claims/579710MCP
get_claim(id=579710)