Benchmark
ScienceWorld
长程具身科学任务基准,要求智能体在模拟环境中完成复杂的科学实验任务,用于评估智能体的长程规划与具身推理能力
Timeline (last 90 days)
Oct 7
研究团队在ScienceWorld和ALFWorld两个交互式环境基准上验证了SAGA,任务完成表现取得提升
Unverified50%
Oct 7
ScienceWorld基于TextWorld引擎构建,要求智能体在文本模拟实验室中完成物理、化学等科学推理任务
Unverified50%
Sep 24
作者在FrozenLake、HotpotQA、ScienceWorld、DeepResearch四个智能体基准上评估了RLDS
Unverified50%
Sep 24
RLDS在ScienceWorld上提升+11.5分(95%置信区间[+9.8, +13.3]),在FrozenLake上提升+9.8分([+7.0, +12.8])
Unverified50%
Sep 24
RLDS在ScienceWorld上每步墙钟时间比标量GRPO减少10.9%,原因是长轨迹摊薄了反思与评分的固定开销
Unverified50%
All Facts (5)
Unverified
研究团队在ScienceWorld和ALFWorld两个交互式环境基准上验证了SAGA,任务完成表现取得提升
50%UnverifiedScienceWorld基于TextWorld引擎构建,要求智能体在文本模拟实验室中完成物理、化学等科学推理任务
50%Unverified作者在FrozenLake、HotpotQA、ScienceWorld、DeepResearch四个智能体基准上评估了RLDS
50%UnverifiedRLDS在ScienceWorld上提升+11.5分(95%置信区间[+9.8, +13.3]),在FrozenLake上提升+9.8分([+7.0, +12.8])
50%UnverifiedRLDS在ScienceWorld上每步墙钟时间比标量GRPO减少10.9%,原因是长轨迹摊薄了反思与评分的固定开销
50%