[KongchangAI]
Benchmark

GraphEcho

专门用于评估LLM图智能体证据冗余问题的基准测试,通过控制路径数量和证据来源两个维度,量化智能体对路径重复与证据实质内容的响应差异

Timeline (last 90 days)

Sep 17

GraphEcho 是 arXiv 上一篇论文提出的基准测试,用于检验图智能体是否会把重复出现的信息误认为额外的印证

Unverified50%
Sep 17

GraphEcho 在保持证据内容固定不变的前提下,系统性地改变路径数量和证据来源两个维度

Unverified50%
Sep 17

GraphEcho 同时评估智能体的判断结论和主动探索行为两个层面

Unverified50%
Sep 17

受控合成实验发现智能体在判断层面的偏移是模型依赖的,没有统一规律

Unverified50%
Sep 17

冗余的支持性路径会增加所有被评估的冻结智能体重复行走的比例

Unverified50%
Sep 17

论文提出了来源感知的后训练方法(PAPT),让智能体在训练中意识到证据的来源属性

Unverified50%
Sep 17

高效探索(减少重复路径)与有效证据利用之间存在鸿沟,减少重复不等于用好证据

Unverified50%
Sep 17

RAG 系统在检索到实质上来自同一信源的多个文档时,同样会面临GraphEcho所揭示的回声问题

Unverified50%

All Facts (8)

Source Articles