Unverified60% confidenceFactExact time
输出Token价格通常为输入的4-6倍,源于预填充与解码两阶段的算力差异,解码阶段GPU利用率可能仅为预填充的10-20%
2
Sources
60%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
GPT-5.6三款模型深度实测:Soul、Tara、Luna实力几何?
bilibiliAI-seeker7/9/2026
Related Claims
Unverified自回归解码阶段GPU算力利用率往往不足10%,属于内存密集型操作77% similarUnverified大语言模型的输出token价格通常是输入的4-8倍,因为输出涉及自回归生成需要多次前向传播,边际成本更高73% similarUnverified输出token通常比输入token更贵,因为输出需要自回归逐token生成,计算密度更高且GPU利用率更低72% similarUnverified主流开源模型在消费级GPU上的推理速度通常在20-80 token/s之间70% similarUnverified同一型号GPU在不同渠道的价格差异可达20%-40%69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/461656API
curl https://kongchang.com/api/v1/knowledge/claims/461656MCP
get_claim(id=461656)