待验证50% 置信事实精确时间
Transformer推理中批量大小为1时注意力层的算术强度约1~10 FLOP/Byte,远低于H100约300 FLOP/Byte的屋脊点,属于带宽受限场景
1
来源数
50%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
待验证批大小为1的Transformer推理算术强度往往低于10 FLOP/Byte,意味着GPU算力利用率不足理论峰值的5%79% 相似待验证标准Transformer自注意力计算量随序列长度平方增长,50万token的注意力计算量约为4096token的15000倍70% 相似待验证Transformer注意力机制的计算量随序列长度平方增长,早期语言模型上下文窗口上限约4000个token69% 相似待验证Transformer注意力机制中的矩阵乘法和Softmax运算占据推理总算力的70%以上,ASIC可实现3至10倍的能效提升66% 相似待验证将FP32权重降至INT8后,典型Transformer模型基准测试分数下降通常不超过1%,推理速度提升2至4倍,内存占用减少75%65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/566571API
curl https://kongchang.com/api/v1/knowledge/claims/566571MCP
get_claim(id=566571)