Unverified50% confidenceBenchmarkExact time
在 RTX Pro 6000(96GB 显存)上,官方 FP8 版配合内置 MTP 投机解码可跑到约 120 tokens/秒,质量与 16-bit 几乎无差异
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/16/2026
First Seen
Valid until: 12/15/2026
Sources
Related Entities
Related Claims
UnverifiedUP主使用 RTX 4080S(16GB 显存)+ 64GB 内存配置运行 MiniCPM 2B,实测推理速度可达约 110 token/秒76% similarUnverified该模型在单张RTX 5090上使用NVFP4方案可达约206 tokens/秒74% similarUnverified社区横向对比数据:M2 Ultra约20 token/秒,M3 Ultra 512GB为39.8 token/秒,单张B200为119.7 token/秒,8张RTX Pro 6000约204 token/秒,改装48GB显存RTX 4090定制后端367 token/秒,双H200约375 token/秒70% similarUnverifiedRTX 4090的理论FP16算力为330 TFLOPS,对于7B FP16模型的Decode实际速度通常在50-60 tokens/s70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/924474API
curl https://kongchang.com/api/v1/knowledge/claims/924474MCP
get_claim(id=924474)