Benchmark
DeepResearch
长文本深度研究智能体基准,涉及多种工具调用,采用复合评分标准评估智能体的长程研究与综合能力
Timeline (last 90 days)
Sep 24
作者在FrozenLake、HotpotQA、ScienceWorld、DeepResearch四个智能体基准上评估了RLDS
Unverified50%
Sep 24
RLDS在HotpotQA和DeepResearch上的提升处于噪声范围内,与这两个任务可回收信息不多的诊断预测一致
Unverified50%
Sep 24
DeepResearch任务涉及搜索、摘要、引用等四种工具,并采用复合评分标准(composite rubric reward)衡量报告质量
Unverified50%