待验证50% 置信基准精确时间
RTX 4090的理论FP16算力为330 TFLOPS,对于7B FP16模型的Decode实际速度通常在50-60 tokens/s
1
来源数
50%
置信度
长期有效
时效性
2026/9/10
首次发现
来源
涉及实体
相关事实
待验证以FP16半精度计算,RTX 4090理论算力约为330 TFLOPS,M2 Ultra的GPU算力约为27.2 TFLOPS79% 相似待验证在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低78% 相似待验证该模型在单张RTX 5090上使用NVFP4方案可达约206 tokens/秒75% 相似待验证RTX 4090算力约165 TFLOPS,而单路推理实际只需约54 TFLOPS,算力严重过剩74% 相似待验证TPU v4单芯片峰值算力约275 TFLOPS(BF16精度),TPU v4-32 pod由32个芯片通过ICI高速互联组成,总算力约8800 TFLOPS73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/887580API
curl https://kongchang.com/api/v1/knowledge/claims/887580MCP
get_claim(id=887580)