待验证75% 置信事实时间未知
MiniCPM和Qwen-0.5B等1B以下轻量模型配合INT4量化可以在手机芯片上运行
1
来源数
75%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
中文预训练模型资源库:覆盖LLM与多模态的5500+ Star开源项目
githublonePatient
涉及实体
相关事实
已验证QLoRA引入4-bit量化技术,使得在单张24GB显存的RTX 3090/4090上微调650亿参数级别的模型成为可能71% 相似待验证Qwen-7B经过4-bit量化后,一张搭载24GB显存的消费级显卡即可流畅运行71% 相似待验证MiniMax M3主打轻量化,单卡即可运行,适合小微企业客服和简单问答场景71% 相似待验证在M4 24GB设备上,9B模型(如qwen3.5-32k:9b-mlx)运行速度快、内存占用小,但无法有效发现代码问题70% 相似待验证Qwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/29980API
curl https://kongchang.com/api/v1/knowledge/claims/29980MCP
get_claim(id=29980)