Unverified50% confidenceFactExact time
模型在每次推理时需要将当前对话的完整历史记录一并输入处理,总结全部内容操作会将整个上下文历史计入输入费用
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified多轮对话的实现方式是每次请求时将之前所有的对话历史全部重新输入给模型,而非模型具有真正的记忆能力76% similarUnverified模型每次响应会将完整对话历史(上下文窗口)计入计费,随着对话轮次增加,单次调用的Token消耗会呈线性甚至超线性增长75% similarVerifiedLLM的'记忆'在技术实现上是将历史对话文本拼接到当前请求的Prompt中,让模型在同一次推理里看到历史内容73% similarUnverified传统ReAct框架要求模型在每次工具调用后将结果写回上下文再重新读取整个对话历史决定下一步,导致Token消耗和延迟累积72% similarUnverified每次大语言模型对话由系统提示、历史对话和用户输入三部分共同构成模型的输入上下文72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/517958API
curl https://kongchang.com/api/v1/knowledge/claims/517958MCP
get_claim(id=517958)