待验证50% 置信事实精确时间
100万Token在FP16精度下仅KV Cache一项即可消耗数百GB显存,远超单张A100/H100的80GB容量上限
1
来源数
50%
置信度
长期有效
时效性
2026/7/22
首次发现
来源
相关事实
待验证支持128K上下文的70B参数模型的KV Cache满负荷时可能需要数百GB显存,超过单张H100的80GB显存容量85% 相似待验证以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存82% 相似待验证对于拥有32层、32头注意力的典型7B模型,每个token需约0.5MB显存存储KV Cache,生成1000个token则需额外约500MB显存76% 相似待验证百万Token级别的单次推理需要数十至数百GB的高端GPU显存(A100/H100级别)76% 相似待验证搭载AMD 780M/Radeon 890M核显的迷你机,需插满双通道内存(2x16GB以上)才能发挥完整核显性能,单条内存会导致核显帧率腰斩约40%76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/593698API
curl https://kongchang.com/api/v1/knowledge/claims/593698MCP
get_claim(id=593698)