BenchmarkLong-Context Memory
Locomo
长期记忆评测基准,侧重评估AI系统跨会话的上下文连贯性与时序推理能力,要求在大量噪声信息中精准召回
Timeline (last 90 days)
Sep 24
Locomo(Long-Context Memory)侧重评估跨会话的上下文连贯性与时序推理
Unverified50%
Sep 16
EvoMem在Gaia、Locomo等传统静态benchmark上同样有效,因为长程任务中多轮交互本身也会改变环境状态
Unverified50%
All Facts (5)
Unverified
MemGAS在四个长期记忆基准上进行评估:Locomo、LongMemEval-S、LongMemEval-M和LongMTBench Plus
95%UnverifiedmemU在Locomo测试中达到了92%的准确率,覆盖单跳、多跳、开放域和时序等多种场景
85%UnverifiedLocomo评测数据集存在局限性,不同Memory框架使用不同的judgment prompt导致分数缺乏可比性
80%UnverifiedLocomo(Long-Context Memory)侧重评估跨会话的上下文连贯性与时序推理
50%UnverifiedEvoMem在Gaia、Locomo等传统静态benchmark上同样有效,因为长程任务中多轮交互本身也会改变环境状态
50%