Unverified50% confidenceBenchmarkExact time
研究者提出了「确定性注意力Transformer」(Deterministic Attention-Transformer),并在NVIDIA H100 GPU上实测到每token仅消耗0.63焦耳的能效表现
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
Unverified标准Transformer自注意力计算量随序列长度平方增长,50万token的注意力计算量约为4096token的15000倍69% similarUnverifiedTransformer注意力机制的计算量随序列长度平方增长,早期语言模型上下文窗口上限约4000个token68% similarUnverifiedTransformer注意力机制中的矩阵乘法和Softmax运算占据推理总算力的70%以上,ASIC可实现3至10倍的能效提升66% similarUnverifiedTransformer推理中批量大小为1时注意力层的算术强度约1~10 FLOP/Byte,远低于H100约300 FLOP/Byte的屋脊点,属于带宽受限场景65% similarUnverified批大小为1的Transformer推理算术强度往往低于10 FLOP/Byte,意味着GPU算力利用率不足理论峰值的5%62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/573235API
curl https://kongchang.com/api/v1/knowledge/claims/573235MCP
get_claim(id=573235)