Unverified50% confidenceBenchmarkExact time
提示处理速度上RTX 4090约3000 tokens/s,M5 Max约800 tokens/s,英伟达在长文档/代码库输入场景优势明显
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/4/2026
First Seen
Valid until: 1/2/2027
Sources
Related Entities
Related Claims
Unverified在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低79% similarVerified在RTX 5090上,Muse Glimmer生成速度从每秒75个Token提升到233个Token,提速约3.1倍75% similarUnverifiedRTX 4090的理论FP16算力为330 TFLOPS,对于7B FP16模型的Decode实际速度通常在50-60 tokens/s72% similarUnverified在 RTX Pro 6000(96GB 显存)上,官方 FP8 版配合内置 MTP 投机解码可跑到约 120 tokens/秒,质量与 16-bit 几乎无差异71% similarUnverifiedGemma量化模型在高性能笔记本电脑上Token生成速度可达每秒20-50个,纯CPU推理约5-15 tokens/秒,INT4量化下NVIDIA RTX 4060/4070可将推理速度提升3-5倍71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/973167API
curl https://kongchang.com/api/v1/knowledge/claims/973167MCP
get_claim(id=973167)