待验证60% 置信事实精确时间
2B参数模型在INT4量化后通常仅需约1-2GB内存,能在主流智能手机、NVIDIA Jetson系列等边缘设备上运行
2
来源数
60%
置信度
长期有效
时效性
2026/9/9
首次发现
来源
涉及实体
相关事实
待验证INT4 量化模型有望在 8GB 乃至更低显存的显卡上完成原本需要 16GB 或 24GB 显存的模型推理69% 相似待验证Google AI Edge Gallery 提供 Gemma 4 1.2B 和 1.4B 两个手机端版本,量化后大小分别为 2.5GB 和 3.6GB69% 相似待验证在16GB内存硬件条件下只能容纳5GB以内的模型,因此该开发者使用了体积约4.8GB的Qwen 2.5 7B 4bit量化模型,配8K上下文窗口68% 相似待验证一个1T参数模型以BF16精度存储需要约2TB显存,INT4量化压缩也需500GB以上68% 相似待验证本地推理受限于用户硬件,一个7B参数量化模型(如Llama 3 8B的Q4版本)文件约4-5GB,在Apple M系列芯片Mac上可达每秒20-40个token,在仅有集成显卡和8GB内存的笔记本上可能降至每秒3-5个token68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/884345API
curl https://kongchang.com/api/v1/knowledge/claims/884345MCP
get_claim(id=884345)