待验证60% 置信事实时间未知
在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s
1
来源数
60%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Hermes + Qwen3.6 本地部署教程:零成本搭建私有AI Agent
bilibili零度解说
涉及实体
相关事实
待验证Qwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度84% 相似待验证RTX 5090上Qwen3.6 27B模型预填充速度从174提升到253 token/s,显存占用约18GB80% 相似待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒79% 相似待验证RTX 5090上Qwen3.6 35B-A3B推理速度达220 token/s,显存占用约23GB78% 相似待验证Qwen-7B经过4-bit量化后,一张搭载24GB显存的消费级显卡即可流畅运行78% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/18000API
curl https://kongchang.com/api/v1/knowledge/claims/18000MCP
get_claim(id=18000)