待验证50% 置信事实精确时间
MOSS-VL-Realtime提供4比特量化版本,按单张RTX 4090设计,110亿参数模型在4比特量化后权重占用可降至约5.5GB显存
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/10
首次发现
有效期至:2026/12/9
来源
涉及实体
相关事实
已验证QLoRA引入4-bit量化技术,使得在单张24GB显存的RTX 3090/4090上微调650亿参数级别的模型成为可能74% 相似已验证700亿参数(70B)的模型经量化后可以在单张RTX 4090(显存24GB)上运行69% 相似待验证约25GB的Q3模型完全在RTX 4090显存(带宽约1TB/s)运行理论上每秒约40个token,而在DDR5内存(约80GB/s)中运行降至每秒1-3个token69% 相似待验证量化后70亿参数模型的显存需求从约28GB压缩至约4-6GB,普通消费级显卡如RTX 3060/4060即可流畅运行Llama 3、Qwen2.5、Mistral等70亿参数级别模型68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/885998API
curl https://kongchang.com/api/v1/knowledge/claims/885998MCP
get_claim(id=885998)