Unverified70% confidenceFactTime unknown
主流开源模型在消费级GPU上的推理速度通常在20-80 token/s之间
1
Sources
70%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
GLM 5.1满血旗舰模型实测400 TPS,两分钟从草图到完整应用
bilibiliAI冷科长
Related Claims
UnverifiedGPU利用率可从低流量时的20%~30%提升至高流量时的70%~80%,因请求量越大越容易聚合为更大计算批次72% similarUnverified许多推理服务的GPU利用率不足30%,通过VGPU技术可将利用率提升至70%以上72% similarUnverified若没有充分优化的软件栈,GPU实际利用率往往只能达到理论峰值的30-50%70% similarUnverified输出Token价格通常为输入的4-6倍,源于预填充与解码两阶段的算力差异,解码阶段GPU利用率可能仅为预填充的10-20%70% similarUnverified同一型号GPU在不同渠道的价格差异可达20%-40%70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/6847API
curl https://kongchang.com/api/v1/knowledge/claims/6847MCP
get_claim(id=6847)