待验证50% 置信事实精确时间
模型在每次推理时需要将当前对话的完整历史记录一并输入处理,总结全部内容操作会将整个上下文历史计入输入费用
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证多轮对话的实现方式是每次请求时将之前所有的对话历史全部重新输入给模型,而非模型具有真正的记忆能力76% 相似待验证模型每次响应会将完整对话历史(上下文窗口)计入计费,随着对话轮次增加,单次调用的Token消耗会呈线性甚至超线性增长75% 相似已验证LLM的'记忆'在技术实现上是将历史对话文本拼接到当前请求的Prompt中,让模型在同一次推理里看到历史内容73% 相似待验证传统ReAct框架要求模型在每次工具调用后将结果写回上下文再重新读取整个对话历史决定下一步,导致Token消耗和延迟累积72% 相似待验证每次大语言模型对话由系统提示、历史对话和用户输入三部分共同构成模型的输入上下文72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/517958API
curl https://kongchang.com/api/v1/knowledge/claims/517958MCP
get_claim(id=517958)