Unverified50% confidenceFactExact time
上下文长度决定模型单次能处理的最大 Token 数,直接影响显存占用
1
Sources
50%
Confidence
Long-term
Relevance
9/10/2026
First Seen
Sources
Related Entities
Related Claims
Unverified自回归生成具有串行依赖性,第N个Token必须等待第N-1个Token生成完毕,导致大模型输出速度通常只有每秒数十Token69% similarUnverifiedReasoning Effort档位越高,模型可消耗的思考Token上限越大,但延迟和Token成本相应线性乃至超线性增长69% similarUnverified大模型每个数字都是逐 token 生成的,而非逐位计算,导致其算术能力在小数、除法、多步混合运算上不稳定68% similarUnverifiedtokens/s指标可细分为首token延迟(TTFT)和生成速率(Generation Throughput)两个子维度67% similarVerified输出Token更贵是因为生成过程需要逐Token自回归推理,每生成一个Token都需要完整的前向计算67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/887835API
curl https://kongchang.com/api/v1/knowledge/claims/887835MCP
get_claim(id=887835)