基准
ReliAgent Bench
用于评测AI智能体长期记忆系统可靠性的评测基准,专注于陈旧记忆解析、状态冲突处理等场景,由独立开发者构建
时间轴 (近 90 天)
9月13日
作者构建了记忆系统TypedMem和评测基准ReliAgent Bench
待验证50%
9月13日
在所有失败案例中,陈旧记忆解析(stale-memory resolution)占了37%
待验证50%
9月13日
引入显式的解析器(resolver)处理信息取代关系后,陈旧记忆类失败降到零,整体准确率从33%跃升至78%
待验证50%
9月13日
本文观点和数据来自单一开发者在Reddit上的分享,ReliAgent Bench尚未经过广泛的第三方验证
待验证50%