待验证50% 置信事实精确时间
GTX 10系(sm_61,GP104芯片)刻意阉割FP16性能,需拆分为两个FP32操作,FP16算力仅约为FP32的一半
1
来源数
50%
置信度
长期有效
时效性
2026/7/25
首次发现
来源
三行代码修复:Tesla P100在llama.cpp中精度提升2300倍
redditr/LocalLLaMA2026/7/12
相关事实
待验证GTX 10系显卡对FP16的硬件加速支持有限,实际速度收益可能低于预期77% 相似待验证GTX 10系列显卡和P40(架构代号sm_61)早已被排除在llama.cpp的fp16快速路径之外,但P100(架构代号sm_60)没有被排除77% 相似待验证NVIDIA H100 GPU原生支持FP8格式,其吞吐量相较FP16提升约2倍73% 相似已验证在配备 Tensor Core 的 NVIDIA GPU(如 A100、H100)上,FP16/BF16 矩阵运算的吞吐量可以达到 FP32 的 2-8 倍73% 相似待验证P100作为数据中心旗舰配备了专用的FP16 SIMD单元,理论上可实现21.2 TFLOPS的FP16算力,是Pascal家族中唯一拥有快速fp16硬件单元的型号69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/613151API
curl https://kongchang.com/api/v1/knowledge/claims/613151MCP
get_claim(id=613151)