待验证50% 置信基准精确时间
Qwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/9
首次发现
有效期至:2026/10/7
来源
Electron+LangGraph实战:从零搭建AI Agent可视化编排应用
bilibili前端AI指南2026/7/2
相关事实
待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s84% 相似待验证Gemma量化模型在高性能笔记本电脑上Token生成速度可达每秒20-50个,纯CPU推理约5-15 tokens/秒,INT4量化下NVIDIA RTX 4060/4070可将推理速度提升3-5倍78% 相似待验证Qwen3.6 35B模型借助MTP技术在oMLX上达到了86.7 tokens/s的生成速度,prompt处理速度为1735 tokens/s76% 相似待验证在M4 24GB设备上,9B模型(如qwen3.5-32k:9b-mlx)运行速度快、内存占用小,但无法有效发现代码问题76% 相似待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/322704API
curl https://kongchang.com/api/v1/knowledge/claims/322704MCP
get_claim(id=322704)