Verified65% confidenceBenchmarkExact time
Qwen2.5-Coder-32B在RTX 4090上以Q4量化运行,推理速度可达每秒40-60个token
3
Sources
65%
Confidence
Medium-term (~90 days)
Relevance
7/12/2026
First Seen
Valid until: 10/10/2026
Sources
AI编程工具数据泄露风险:量化策略安全防护指南
bilibili国金证券宜宾营业部7/8/2026
Related Claims
Verified实测中Qwen3 27B在未开启NVLink的4张魔改2080Ti上生成速度约为40多token/秒80% similarUnverified运行Qwen 3(27B)无优化基线token解码速度:RTX 5090约75、RTX 4090约46、RTX 3090约40、M5 Max 31.4、DGX Spark 12-17、Ryzen AI Max 11.5 tokens/s78% similarUnverifiedQwen3 27B本地推理速度约为每秒10个tokens77% similarUnverifiedNVIDIA RTX 4090运行类似规模的Q4量化模型的典型生成速度在40~60 TPS范围内77% similarUnverifiedQwen 27B的Q4_K_M/GGUF版本在同一台机器上解码速度约为10.7 tok/s,约为MLX版本的1/3.876% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489658API
curl https://kongchang.com/api/v1/knowledge/claims/489658MCP
get_claim(id=489658)