AdaMem
AdaMem是一种面向RAG的软压缩方法,通过相关性引导的动态记忆token分配,使用共享的查询条件压缩器在单次前向传播中同时生成段落记忆表示和相关性分数,实现对有限记忆预算的高效利用。
时间轴 (近 90 天)
AdaMem是一个由相关性引导的软压缩框架,通过将学习到的段落相关性估计映射为对固定记忆token预算的查询相关动态分配
AdaMem使用共享的、以查询为条件的压缩器,在一次前向传播中同时产出连续的段落记忆表示和每个段落的相关性分数
AdaMem通过确定性的分配规则划分记忆token,给得分更高的段落分配更多记忆token,并可直接省略得分过低的段落
AdaMem在六个开放域问答基准上评测,在相同记忆预算下持续优于OSCAR及其他软压缩方法
在16倍压缩下,AdaMem的子串匹配相比均匀分配基线最高提升3.2个百分点(5.5%),平均相对增益为3.4%
在64倍压缩下,AdaMem平均相对增益扩大到14.6%,在PopQA数据集上最高提升9.8个百分点(19.7%)
压缩比越高、预算越紧张,智能分配相比均匀分配的优势越大
AdaMem相比全上下文推理,推理延迟最高可降低4倍,并能在延迟低至全上下文基线1/4的情况下匹配未压缩方案的答案质量
全部知识事实 (8)
AdaMem是一个由相关性引导的软压缩框架,通过将学习到的段落相关性估计映射为对固定记忆token预算的查询相关动态分配
50%待验证AdaMem使用共享的、以查询为条件的压缩器,在一次前向传播中同时产出连续的段落记忆表示和每个段落的相关性分数
50%待验证AdaMem通过确定性的分配规则划分记忆token,给得分更高的段落分配更多记忆token,并可直接省略得分过低的段落
50%待验证AdaMem在六个开放域问答基准上评测,在相同记忆预算下持续优于OSCAR及其他软压缩方法
50%待验证在16倍压缩下,AdaMem的子串匹配相比均匀分配基线最高提升3.2个百分点(5.5%),平均相对增益为3.4%
50%待验证在64倍压缩下,AdaMem平均相对增益扩大到14.6%,在PopQA数据集上最高提升9.8个百分点(19.7%)
50%待验证压缩比越高、预算越紧张,智能分配相比均匀分配的优势越大
50%待验证AdaMem相比全上下文推理,推理延迟最高可降低4倍,并能在延迟低至全上下文基线1/4的情况下匹配未压缩方案的答案质量
50%