Unverified60% confidenceFactTime unknown
自回归解码阶段GPU算力利用率往往不足10%,属于内存密集型操作
2
Sources
60%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Qwen3.6 MTP加速实测:单GPU推理飙到220 token/s
bilibili普通鱼学家呀
Related Entities
Related Claims
Unverified大模型推理时实际GPU利用率往往不足10%85% similarUnverified输出Token价格通常为输入的4-6倍,源于预填充与解码两阶段的算力差异,解码阶段GPU利用率可能仅为预填充的10-20%77% similarUnverified对于MuJoCo、Atari等环境,单个环境的采样速度往往跟不上GPU计算能力,导致GPU利用率长期停留在20%–40%甚至更低74% similarUnverified测试中4块GPU中只有1块的利用率达到约10%-13%,其余几乎处于空闲状态,而CPU使用率高达50%左右74% similarUnverified许多推理服务的GPU利用率不足30%,通过VGPU技术可将利用率提升至70%以上73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18051API
curl https://kongchang.com/api/v1/knowledge/claims/18051MCP
get_claim(id=18051)