已过期50% 置信基准精确时间
该模型在单张RTX 5090上使用NVFP4方案可达约206 tokens/秒
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/9/5
首次发现
有效期至:2026/9/19(已过期)
来源
涉及实体
相关事实
待验证在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低80% 相似待验证在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒71% 相似已验证700亿参数(70B)的模型经量化后可以在单张RTX 4090(显存24GB)上运行70% 相似待验证将8个请求合并批处理时,单张RTX PRO 6000能够达到约220 output tok/s的聚合吞吐量,而两张RTX 3090的旧配置只有约19 tok/s70% 相似待验证RTX 4060生成速度可达GTX 1060的3-5倍69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/862144API
curl https://kongchang.com/api/v1/knowledge/claims/862144MCP
get_claim(id=862144)