[控场AI]
基准

FrozenLake

稀疏奖励的网格导航强化学习基准环境,智能体需在冰冻湖面网格中从起点导航至终点,奖励信号稀疏,常用于测试强化学习算法的信用分配能力

时间轴 (近 90 天)

9月24日

作者在FrozenLake、HotpotQA、ScienceWorld、DeepResearch四个智能体基准上评估了RLDS

待验证50%
9月24日

RLDS在ScienceWorld上提升+11.5分(95%置信区间[+9.8, +13.3]),在FrozenLake上提升+9.8分([+7.0, +12.8])

待验证50%
9月11日

将VQC应用于CartPole、FrozenLake等经典RL基准环境已有多篇论文可供复现和对比

待验证50%

全部知识事实 (3)

来源文章