Unverified50% confidenceFactExact time
在多轮对话中,每一轮新回复生成前系统都需将此前所有对话历史重新输入模型,导致token消耗随轮次累积增长
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
Unverified多轮对话的实现方式是每次请求时将之前所有的对话历史全部重新输入给模型,而非模型具有真正的记忆能力84% similarUnverified模型每次响应会将完整对话历史(上下文窗口)计入计费,随着对话轮次增加,单次调用的Token消耗会呈线性甚至超线性增长83% similarUnverified传统ReAct框架要求模型在每次工具调用后将结果写回上下文再重新读取整个对话历史决定下一步,导致Token消耗和延迟累积76% similarUnverified每次大语言模型对话由系统提示、历史对话和用户输入三部分共同构成模型的输入上下文75% similarUnverifiedSystem消息在对话中被注入到最前端,模型在生成响应时优先遵循系统级约定74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/569964API
curl https://kongchang.com/api/v1/knowledge/claims/569964MCP
get_claim(id=569964)