[控场AI]
基准

GraphEcho

专门用于评估LLM图智能体证据冗余问题的基准测试,通过控制路径数量和证据来源两个维度,量化智能体对路径重复与证据实质内容的响应差异

时间轴 (近 90 天)

9月17日

GraphEcho 是 arXiv 上一篇论文提出的基准测试,用于检验图智能体是否会把重复出现的信息误认为额外的印证

待验证50%
9月17日

GraphEcho 在保持证据内容固定不变的前提下,系统性地改变路径数量和证据来源两个维度

待验证50%
9月17日

GraphEcho 同时评估智能体的判断结论和主动探索行为两个层面

待验证50%
9月17日

受控合成实验发现智能体在判断层面的偏移是模型依赖的,没有统一规律

待验证50%
9月17日

冗余的支持性路径会增加所有被评估的冻结智能体重复行走的比例

待验证50%
9月17日

论文提出了来源感知的后训练方法(PAPT),让智能体在训练中意识到证据的来源属性

待验证50%
9月17日

高效探索(减少重复路径)与有效证据利用之间存在鸿沟,减少重复不等于用好证据

待验证50%
9月17日

RAG 系统在检索到实质上来自同一信源的多个文档时,同样会面临GraphEcho所揭示的回声问题

待验证50%

全部知识事实 (8)

来源文章