[控场AI]
基准

ReliAgent Bench

用于评测AI智能体长期记忆系统可靠性的评测基准,专注于陈旧记忆解析、状态冲突处理等场景,由独立开发者构建

时间轴 (近 90 天)

9月13日

作者构建了记忆系统TypedMem和评测基准ReliAgent Bench

待验证50%
9月13日

在所有失败案例中,陈旧记忆解析(stale-memory resolution)占了37%

待验证50%
9月13日

引入显式的解析器(resolver)处理信息取代关系后,陈旧记忆类失败降到零,整体准确率从33%跃升至78%

待验证50%
9月13日

本文观点和数据来自单一开发者在Reddit上的分享,ReliAgent Bench尚未经过广泛的第三方验证

待验证50%

全部知识事实 (4)

来源文章