待验证50% 置信事实精确时间
2B模型单次推理约需4-10 TFLOPs计算量,在A100 GPU上耗时10-50毫秒;而70B模型需140-350 TFLOPs,耗时可达数秒
1
来源数
50%
置信度
长期有效
时效性
2026/9/9
首次发现
来源
涉及实体
相关事实
待验证以FP16半精度计算,RTX 4090理论算力约为330 TFLOPS,M2 Ultra的GPU算力约为27.2 TFLOPS73% 相似待验证主流GPU推理方案(如基于NVIDIA H100的部署)在27B规模模型上通常只能达到每秒数十到一两百token的水平72% 相似待验证Flash模型因推理速度快(单请求耗时50-200ms vs 旗舰模型500-2000ms),在相同TPM限制下可支持更高QPS69% 相似待验证实测在RTX 3060(6GB显存)、32GB RAM上运行预量化Krea2 Turbo,1024×1024分辨率8步Euler采样,速度为1.78 s/it,总耗时17.64秒68% 相似待验证测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/882138API
curl https://kongchang.com/api/v1/knowledge/claims/882138MCP
get_claim(id=882138)