待验证50% 置信事实精确时间
Qwen3-27B的16个全注意力层每层拥有4个KV头、256的头维度,在16位精度下每个Token占用64KB
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB77% 相似待验证序列长度为4096时,N×N注意力矩阵在FP16精度下仅此一项就消耗约64MB显存77% 相似待验证170k tokens场景下,注意力得分矩阵在BF16精度下约需54GB显存(170000×170000×2字节)76% 相似待验证使用IQ4_XS配合-fa 1 -ctk q8_0 -ctv q8_0对KV缓存进行q8_0量化后,可加载完整32k上下文,常驻内存约16.6GB76% 相似已验证以70B参数模型、FP16精度、32层注意力头为例,单条200K长度请求的KV Cache约需80-120GB显存,远超单张A100 GPU的80GB显存上限75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/907268API
curl https://kongchang.com/api/v1/knowledge/claims/907268MCP
get_claim(id=907268)