Context Language Model
由Meta与华盛顿大学提出的AI上下文管理方法,允许语言模型通过生成并执行代码来主动编辑自身上下文窗口,将上下文视为可读写的工作内存而非只可追加的日志,从而替代传统的一次性摘要压缩方案
时间轴 (近 90 天)
Context Language Model用更灵活的上下文管理换取了更高的推理成本,该权衡是否划算取决于任务对上下文质量的敏感程度和推理成本承受能力
Context Language Model由来自Meta与华盛顿大学的研究团队提出
在Context Language Model范式下,智能体可以缩短一段过时的工具输出,或用简短的笔记整体替换掉某块不再重要的内容
压缩是被动的、全局的、无差别的,而自编辑是主动的、局部的、有选择性的
Context Language Model会破坏前缀缓存(prefix caching),因为它不断修改上下文的历史内容,一旦前面内容被编辑,缓存的前缀就失效
视频作者在自己的DGX设备上使用本地模型对Context Language Model方法进行实验验证,但本段素材未展开实验的具体结论
在货车封条代码追踪任务中,摘要基线第一次摘要列出12个封条代码中11个为幻觉,第三次摘要18个代码中14个为编造;而Py CLM在同任务中18个代码全部准确
要让CLM真正发挥作用,必须开启每轮只调用一个工具,并在每次结果后生成一段笔记,否则并行工具调用会导致上下文撑爆
CLM中模型编辑文件的位置影响前缀缓存复用:改动在文件末尾可大部分复用缓存,从中间编辑会使该点之后内容丢失缓存,增加延迟和成本
CLM不会自动降低成本,实测中有一次Py CLM处理的token量约为Py的两倍,另一次只有10%的prompt来自缓存
还有 10 条时间轴事件
全部知识事实 (20)
Context Language Model用更灵活的上下文管理换取了更高的推理成本,该权衡是否划算取决于任务对上下文质量的敏感程度和推理成本承受能力
50%待验证Context Language Model会破坏前缀缓存(prefix caching),因为它不断修改上下文的历史内容,一旦前面内容被编辑,缓存的前缀就失效
50%待验证Context Language Model由来自Meta与华盛顿大学的研究团队提出
50%待验证在Context Language Model范式下,智能体可以缩短一段过时的工具输出,或用简短的笔记整体替换掉某块不再重要的内容
50%待验证压缩是被动的、全局的、无差别的,而自编辑是主动的、局部的、有选择性的
50%待验证在BrowseComp-Plus基准上,CLM配合Qwen3 27B取得59.4%,比最好的摘要方案高约11%,计算量少约五分之一
50%待验证在货车封条代码追踪任务中,摘要基线第一次摘要列出12个封条代码中11个为幻觉,第三次摘要18个代码中14个为编造;而Py CLM在同任务中18个代码全部准确
50%待验证要让CLM真正发挥作用,必须开启每轮只调用一个工具,并在每次结果后生成一段笔记,否则并行工具调用会导致上下文撑爆
50%待验证CLM中模型编辑文件的位置影响前缀缓存复用:改动在文件末尾可大部分复用缓存,从中间编辑会使该点之后内容丢失缓存,增加延迟和成本
50%待验证CLM不会自动降低成本,实测中有一次Py CLM处理的token量约为Py的两倍,另一次只有10%的prompt来自缓存
50%待验证在128000 token预算时,CLM和摘要的表现基本打平,CLM的优势主要体现在32000 token这类小预算场景
50%待验证CLM引入新的prompt injection攻击面:注入的恶意指令可持久化到上下文文件并跨多轮存活,甚至主动阻止自己被删除,论文作者将其列为未解决隐患
50%待验证论文中的90亿参数模型在用强化学习训练前,比干净的摘要落后6分
50%待验证Context Language Model(CLM)是由Meta与华盛顿大学提出的论文,核心思想是让模型自己编辑自己的上下文窗口,而非做一次性总结
50%待验证CLM将上下文从只可追加的线性序列转变为可读写的工作内存,模型可保留、收缩、删除或重写其中任何部分
50%待验证CLM的实现方式是harness在每次请求前把当前上下文写入文件,模型通过生成并运行Python脚本修改该文件,修改后剩下的内容成为下一轮prompt
50%待验证论文构建了小型基准ContextBench,大多数现有压缩技术在该基准上直接失败
50%待验证上下文感知生成(context-aware generation)要求模型不仅掌握变化内容,还要以合适的语气和格式表达变化,保持与既有文档体系的一致性
50%待验证视频作者在自己的DGX设备上使用本地模型对Context Language Model方法进行实验验证,但本段素材未展开实验的具体结论
50%待验证作者已发布Py的CLM扩展,可一行命令安装,在Py内输入/CLM即可打开展示上下文体积变化和编辑对比的面板
50%