Unverified50% confidenceFactExact time
LLaMA-2 70B 总参数约 700 亿均匀分布于 80 层,每层约 8.75 亿参数,FP16 精度下单层约占 1.75GB 显存
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
UnverifiedLLaMA-2 70B 模型共有 80 个 Transformer 层,每层约 8.75 亿参数,FP16 精度下单层约占 1.75GB 显存83% similarUnverified运行700亿参数级别开源模型在 FP16 精度下至少需要约 140GB 显存,即 8 张 H100 并行77% similarPartially Verified以 65B 参数的 LLaMA 模型为例,传统全量微调需要 780GB 以上显存,而 QLoRA 仅需约 48GB77% similarVerified以70B参数模型、FP16精度、32层注意力头为例,单条200K长度请求的KV Cache约需80-120GB显存,远超单张A100 GPU的80GB显存上限74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/563762API
curl https://kongchang.com/api/v1/knowledge/claims/563762MCP
get_claim(id=563762)