Unverified50% confidenceFactExact time
在35B参数模型中GEMM内核往往占据总计算时间的60-80%
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
UnverifiedH100内存子系统的动态功耗在大模型推理中占比可达整卡功耗的20%~35%72% similarUnverified34B 80层模型比27B推理时间增加约18%69% similarUnverified参数量在1亿以下的轻量模型经领域数据微调后可达95%以上意图分类准确率,单次推理延迟控制在5-20ms以内66% similarUnverified业界顶级集群的MFU(模型算力利用率)通常在35%-60%之间65% similarUnverified在完整的AI应用系统中,GPU推理通常只占总计算量的30%-40%,其余60%-70%的计算负载由CPU承担64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/566988API
curl https://kongchang.com/api/v1/knowledge/claims/566988MCP
get_claim(id=566988)