[KongchangAI]
Benchmark

ContextBench

由Meta与华盛顿大学提出的用于评估AI智能体上下文管理能力的基准测试集,包含需要持续追踪状态的任务(如实时维护数独棋盘),用于测试模型在长任务中的信息保留与上下文管理能力

Timeline (last 90 days)

Oct 5

论文构建了小型基准ContextBench,大多数现有压缩技术在该基准上直接失败

Unverified50%

All Facts (1)

Source Articles