待验证50% 置信事实精确时间
上下文长度决定模型单次能处理的最大 Token 数,直接影响显存占用
1
来源数
50%
置信度
长期有效
时效性
2026/9/10
首次发现
来源
涉及实体
相关事实
待验证自回归生成具有串行依赖性,第N个Token必须等待第N-1个Token生成完毕,导致大模型输出速度通常只有每秒数十Token69% 相似待验证Reasoning Effort档位越高,模型可消耗的思考Token上限越大,但延迟和Token成本相应线性乃至超线性增长69% 相似待验证大模型每个数字都是逐 token 生成的,而非逐位计算,导致其算术能力在小数、除法、多步混合运算上不稳定68% 相似待验证tokens/s指标可细分为首token延迟(TTFT)和生成速率(Generation Throughput)两个子维度67% 相似已验证输出Token更贵是因为生成过程需要逐Token自回归推理,每生成一个Token都需要完整的前向计算67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/887835API
curl https://kongchang.com/api/v1/knowledge/claims/887835MCP
get_claim(id=887835)