[KongchangAI]
Benchmark

DeepResearch

长文本深度研究智能体基准,涉及多种工具调用,采用复合评分标准评估智能体的长程研究与综合能力

Timeline (last 90 days)

Sep 24

作者在FrozenLake、HotpotQA、ScienceWorld、DeepResearch四个智能体基准上评估了RLDS

Unverified50%
Sep 24

RLDS在HotpotQA和DeepResearch上的提升处于噪声范围内,与这两个任务可回收信息不多的诊断预测一致

Unverified50%
Sep 24

DeepResearch任务涉及搜索、摘要、引用等四种工具,并采用复合评分标准(composite rubric reward)衡量报告质量

Unverified50%

All Facts (3)

Source Articles