待验证50% 置信基准精确时间
NVIDIA RTX 4090运行类似规模的Q4量化模型的典型生成速度在40~60 TPS范围内
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/6
首次发现
有效期至:2026/12/5
来源
涉及实体
相关事实
待验证实测中Qwen3 27B在未开启NVLink的4张魔改2080Ti上生成速度约为40多token/秒80% 相似待验证将模型权重从FP16压缩到INT8或INT4的量化技术,可使消费级GPU如RTX 4090在本地部署时达到30-80 TPS的实用速度79% 相似已验证NVIDIA H100单卡FP64双精度浮点性能达到约34 TFLOPS77% 相似已验证Qwen2.5-Coder-32B在RTX 4090上以Q4量化运行,推理速度可达每秒40-60个token77% 相似待验证以FP16半精度计算,RTX 4090理论算力约为330 TFLOPS,M2 Ultra的GPU算力约为27.2 TFLOPS75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/867055API
curl https://kongchang.com/api/v1/knowledge/claims/867055MCP
get_claim(id=867055)