Benchmark
ContextBench
由Meta与华盛顿大学提出的用于评估AI智能体上下文管理能力的基准测试集,包含需要持续追踪状态的任务(如实时维护数独棋盘),用于测试模型在长任务中的信息保留与上下文管理能力
Timeline (last 90 days)
Oct 5
论文构建了小型基准ContextBench,大多数现有压缩技术在该基准上直接失败
Unverified50%
由Meta与华盛顿大学提出的用于评估AI智能体上下文管理能力的基准测试集,包含需要持续追踪状态的任务(如实时维护数独棋盘),用于测试模型在长任务中的信息保留与上下文管理能力
论文构建了小型基准ContextBench,大多数现有压缩技术在该基准上直接失败