待验证50% 置信事实精确时间
处理128K Token序列所需的注意力矩阵大小是8K Token序列的256倍
1
来源数
50%
置信度
长期有效
时效性
2026/9/4
首次发现
来源
涉及实体
相关事实
已验证对于拥有32层、32头注意力的典型7B模型,每个token需约0.5MB显存存储KV Cache,生成1000个token则需额外约500MB显存74% 相似待验证主流BPE词表规模通常为32K-128K,全量成对相似度矩阵的内存占用可超过数十GB74% 相似待验证200K token的上下文请求相比8K token请求,需要约25倍的KV-Cache显存72% 相似待验证液态卷积的计算复杂度与序列长度呈线性关系O(n),而非自注意力的平方关系O(n²),处理128K Tokens时计算量仅为注意力层的约1/100072% 相似待验证128K指模型的上下文窗口大小,即模型单次可以处理约128,000个Token的输入信息71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/854177API
curl https://kongchang.com/api/v1/knowledge/claims/854177MCP
get_claim(id=854177)