Verified65% confidenceFactTime unknown
32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行
3
Sources
65%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
阿里QwQ-32B开源:32B参数如何媲美671B的DeepSeek R1
bilibiliAI大模型全栈
Related Entities
Related Claims
UnverifiedRTX 4090拥有24GB显存,在加载27B Q4模型后通常还有足够空间支持3-4万Token的上下文84% similarVerified一个原本需要60GB显存的30B参数模型,经过量化后能在16GB甚至8GB显存的消费级显卡上运行82% similarVerified一个70B参数的FP16模型大约需要140GB显存,INT8量化后约需70GB,INT4量化后约需35-40GB80% similarUnverified140GB的FP16 70B模型经4-bit量化后可压缩至约35-40GB,通信开销降低约75%;2-bit量化可压缩至约18GB但带来精度损失80% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/23201API
curl https://kongchang.com/api/v1/knowledge/claims/23201MCP
get_claim(id=23201)