待验证50% 置信基准精确时间
运行Qwen 3(27B)无优化基线token解码速度:RTX 5090约75、RTX 4090约46、RTX 3090约40、M5 Max 31.4、DGX Spark 12-17、Ryzen AI Max 11.5 tokens/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/4
首次发现
有效期至:2027/1/2
来源
涉及实体
相关事实
已验证Qwen2.5-Coder-32B在RTX 4090上以Q4量化运行,推理速度可达每秒40-60个token78% 相似待验证Qwen 27B的Q4_K_M/GGUF版本在同一台机器上解码速度约为10.7 tok/s,约为MLX版本的1/3.878% 相似已验证在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒77% 相似已验证实测中Qwen3 27B在未开启NVLink的4张魔改2080Ti上生成速度约为40多token/秒76% 相似待验证在一台128G算力舱设备上,Qwen3.8 Flash的解码速度常态达241 TPS,峰值达274 TPS75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/973165API
curl https://kongchang.com/api/v1/knowledge/claims/973165MCP
get_claim(id=973165)