Declarative Attention:让LLM自主控制注意力,长文本推理效率提升52%

核心问题:长文本注意力的计算困境
当前大型语言模型在处理长上下文时面临一个根本性矛盾:模型的注意力实际上只集中在少数关键token上,却不得不扫描整个KV缓存来定位这些重要信息。
Transformer注意力机制的计算复杂度背景
Transformer架构自2017年提出以来,其核心的自注意力(self-attention)机制在处理序列数据时需要计算每个token与所有其他token之间的关联度。这导致计算复杂度为O(N²),其中N是序列长度。在实际部署中,模型使用KV缓存(Key-Value Cache)来避免重复计算历史token的键值对,但每次生成新token时仍需将查询向量(Query)与缓存中所有历史键向量(Key)进行点积运算,即O(N)复杂度。当上下文长度从几千扩展到百万级token时,这种线性扫描成为推理延迟和显存占用的主要瓶颈,限制了长文本应用的实用性。
举个具体例子,当用户在一个包含100万token的对话中询问先前的某个细节时,全局注意力层必须在生成每个回复token时扫描全部上下文。这种O(N)级别的计算开销,严重制约了长文本推理的效率和实际可用性。
现有方案试图通过轻量级代理评分来预先筛选相关token,但这种外部评分机制仍需在每一步进行全量扫描,并未从根本上解决问题。研究者由此提出了一个本质性的追问:模型难道不应该自己知道上下文的哪些部分是相关的吗?
![reddit source: Language Models Can Control Their Own Attention [R]](/media/screenshots/source/24295_0.png)
Declarative Attention机制设计:三种注意力声明模式
Declarative Attention(DA)采用一种内在驱动的方法,让模型在思维链(chain-of-thought)推理过程中主动声明需要关注的区域。
思维链推理与中间推理步骤
思维链(Chain-of-Thought, CoT)是一种让大语言模型通过生成中间推理步骤来解决复杂问题的提示技术。与直接输出答案不同,CoT让模型逐步展开推理过程,例如"首先识别问题类型→然后定位相关信息→接着分析证据→最后得出结论"。这种方式显著提升了多步推理任务的准确性。Declarative Attention正是利用这一机制,在推理链的不同阶段插入注意力声明,让模型在生成推理步骤的同时显式指示需要关注的上下文范围,从而将计算资源集中在真正相关的区域。
这一协议将生成过程划分为三种模式:
<global>模式:全局上下文访问
访问完整上下文,适用于需要全局信息的场景,例如对整篇文档进行总结或回答需要跨段落关联的问题。
<focus>模式:精确区域聚焦
聚焦于特定区域,精确定位相关片段。当模型已经判断出目标信息的大致位置时,可以通过该模式大幅缩小注意力扫描范围。
<local>模式:局部连续生成
仅关注最近的输出内容,适合连续生成任务。在不需要回溯上下文的生成阶段,该模式能最大程度地减少计算开销。
推理引擎像解析工具调用一样处理这些声明,从而跳过大部分KV缓存的读取操作。DA的关键创新在于,它将注意力控制权交给模型本身,利用模型对上下文相关性的内在理解来优化计算路径,而非依赖外部的启发式规则。
零样本评估表现:效率与准确率的权衡
研究团队在15个长文本任务上对现成模型进行了零样本评估,测试对象包括Gemma-4-31B和Qwen-3.6-27B。结果展现出令人瞩目的效率提升:
| 模型 | 注意力token减少量 | 准确率下降 |
|---|---|---|
| Gemma-4-31B | 52.0% | 仅1.27个百分点 |
| Qwen-3.6-27B | 31.1% | 2.75个百分点 |
更值得关注的是,随着模型规模增大,准确率损失呈现缩小趋势。这表明更强大的模型能够更准确地判断哪些上下文区域需要关注。
对于实际应用场景而言,略微的准确率下降换取接近一半的计算量减少,这在文档问答、长对话摘要、代码分析等多数任务中是完全可接受的折衷方案。
稀疏注意力研究的新方向
稀疏注意力研究的演进脉络
稀疏注意力(Sparse Attention)是降低Transformer计算复杂度的核心研究方向。早期方案如Longformer使用固定的滑动窗口+全局token模式,BigBird采用随机注意力+窗口注意力的混合策略。这些方法的局限在于预定义的稀疏模式无法适应不同内容的实际需求。近年出现基于学习的动态稀疏方法,如通过轻量级网络预测注意力分数来筛选token,但这些外部评分器仍需扫描全部KV缓存。Declarative Attention的创新在于将稀疏性决策权完全交给模型自身的语言理解能力,通过符号化协议(类似函数调用)让模型在推理过程中主动声明注意力范围,实现了内容感知的自适应稀疏化。
Declarative Attention为稀疏注意力研究开辟了一个全新维度。传统的稀疏注意力方法主要依赖预定义的模式(如滑动窗口、固定跨度)或外部启发式规则,而DA让模型能够动态地、基于实际内容来决定注意力分配策略。这种自适应特性使其能够更灵活地适应不同任务的特定需求。
论文指出,当前的零样本结果仅是这一研究方向的起点。未来结合训练方法可进一步释放DA的潜力:
- 强化学习优化:通过RL训练模型学习更精准的注意力声明策略
- 预训练阶段引入DA:从训练早期就让模型具备注意力自主调控的能力
- 与现有KV缓存压缩技术协同:在已有的缓存优化基础上叠加DA带来的收益
KV缓存压缩技术生态
KV缓存优化是大模型推理加速的另一条重要路线。现有技术包括:量化方法将FP16的键值对压缩为INT8甚至INT4以减少显存占用;驱逐策略如H2O根据注意力分数动态淘汰不重要的历史token;分组查询注意力(GQA)让多个查询头共享少量键值头来降低缓存规模。这些技术主要作用于存储和传输层面,而Declarative Attention作用于计算逻辑层,通过跳过不相关区域的注意力计算来节省FLOPs。两者的优化维度正交互补,可以叠加使用:DA减少需要读取的缓存范围,量化和驱逐进一步压缩实际存储的缓存数据,形成多层次的协同优化。
从架构设计角度看,DA的协议化思路具有更广泛的启示意义:将推理过程中的控制逻辑显式化,使其可被解析和优化。这种范式不仅适用于注意力机制,在模型推理的其他环节同样可能发挥作用,为LLM推理效率的整体优化提供了新的思考框架。
相关推荐

Hot Chips大会:AI芯片军备竞赛全面升级
Hot Chips大会汇聚OpenAI Jalapeño自研芯片、Cerebras CS-5晶圆级引擎、Groq LPX推理芯片及Apple M6等重磅产品,深度解析AI芯片多元竞争格局与技术趋势。

GPT-6 Astra代码审查实测:效率收益、数据隐私与成本如何权衡
深入分析GPT-6 Astra在代码审查中的实际表现,从效率收益、数据隐私风险和Token成本三个维度拆解工程团队引入AI审查工具的决策框架,探讨人机协同的最优策略。

Meta高管被曝种子盗版:AI训练数据合法性争议再升级
Meta高管因BitTorrent盗版被追踪曝光,事件引发AI训练数据合法性的广泛讨论。从合理使用辩护到数据合规趋势,深度解析科技巨头面临的版权困境与行业启示。