上下文窗口
大模型在单次推理中能够接收和处理的最大信息量限制,以Token数量衡量,决定了Agent可注入历史信息的上限,是影响长对话连贯性的核心约束。
核心事实
时间轴 (近 90 天)
在多轮交互中每一轮输入需携带完整历史对话记录(上下文窗口),导致第N轮输入Token数量约等于前N-1轮内容的总和
演示中将本地智能体的上下文窗口拉到最高 100 万 token
上下文窗口决定模型单次推理能看到的最大Token数量,当项目文件超出窗口后模型会遗忘早期内容,导致前后不一致的代码甚至报错
Harness 通过跟踪已完成的任务来管理上下文窗口,使有限的 token 配额利用率更高
随着任务链条延长,上下文窗口的容量限制与注意力衰减会影响模型对初始目标的把握精度,这是长时任务中'目标漂移'现象的根本成因之一
上下文窗口指模型一次能读取的输入总量,输出窗口指模型一次能连续生成的文本上限
2023 年前后上下文窗口从 4K 扩展到 128K,曾有声音认为超长上下文将改变检索增强生成(RAG)的必要性
输入上下文窗口和输出长度上限是两个独立的参数,前者决定模型能读取多长的输入,后者决定单次能生成多长的内容
大模型在每次对话中只能处理有限长度的上下文窗口
Helix的执行全部交由子Agent完成,核心原因是上下文窗口的隔离,每个任务保留独立的上下文窗口以避免信息过载导致的质量下滑
还有 40 条时间轴事件
全部知识事实 (20)
大语言模型的上下文窗口决定了模型在单次推理中能处理的信息量上限
90%已验证AI Agent 相比传统脚本具有不可预测性,存在幻觉、误解上下文、遭受 prompt 注入攻击等固有风险
80%已验证大语言模型在长时间对话中会因上下文窗口限制而丢失早期信息
80%已验证主流技能包执行方式是将技能指令加载到智能体的上下文窗口中,依赖智能体自身理解并遵循这些指令
75%已验证企业级Agent系统通常会引入外部记忆模块(如向量数据库)来存储长期记忆,以突破上下文窗口限制
75%已验证上下文窗口是指模型在单次对话中能处理的最大文本量,早期模型仅有4K Token,现代模型已扩展至数十万Token
70%已验证更大的上下文意味着每次请求消耗更多Token,会相应增加API调用费用
70%已验证当前主流大语言模型的上下文窗口通常在8K到200K token之间
65%已验证上下文窗口决定了模型在单次对话中能记住多少内容
65%已验证目前主流模型的上下文窗口已支持10万到200万token
65%已验证上下文窗口(Context Window)指模型单次交互中能处理的最大token数量
65%已验证过于冗长、矛盾或模糊的系统提示词会导致模型注意力分散,产生过度思考或指令遵循失败,精简 agents.md 可提升指令遵循的确定性
65%已验证上下文窗口是大模型单次能够处理的最大信息量,以token为单位计算,现代顶级模型的上下文窗口已从早期的4K token扩展至200K token甚至更高
65%已验证早期模型上下文窗口较小,约为4K–8K Token
65%已验证LLM的记忆依赖于上下文窗口,即模型在单次推理时能够处理的最大Token数量
65%已验证100万token相当于约750万个英文单词
65%待验证仅靠扩大上下文窗口无法解决Agent的长期记忆问题
85%待验证对话式编程的核心瓶颈在于大语言模型的上下文窗口限制,面对数十万行代码的企业级项目无法一次性加载全部代码库
85%待验证即使模型标称支持128K甚至1M token的上下文窗口,其有效利用能力往往远低于标称值,实际可靠工作范围可能只有标称值的几分之一
80%待验证本地运行的开源LLM模型通常只有4K到32K tokens的上下文容量,受硬件内存限制
75%