待验证50% 置信事实精确时间
UP主使用FP8精度部署千问3.8 27B在48GB显卡上,跑4个并发request占用约46GB
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/18
首次发现
有效期至:2026/11/16
来源
相关事实
待验证35B模型在FP16精度下需要约70GB显存,远超RTX 5090的32GB容量,因此单卡部署需量化75% 相似已验证以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB72% 相似待验证双卡 24GB 张量并行配置在 f16 精度下上下文支持从 134,049 增至 262,144 token72% 相似待验证FP8量化可将7B模型权重从约14GB(FP16)压缩至约7GB72% 相似待验证NVIDIA A100的显存带宽为2TB/s,加载280GB的FP32模型需要约140ms,仅权重加载就决定了每秒最多生成约7个token71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/768404API
curl https://kongchang.com/api/v1/knowledge/claims/768404MCP
get_claim(id=768404)