基准
REVERSAL-BENCH
针对无重置强化学习(reset-free RL)的评测基准,通过连续可逆性参数ρ量化环境可逆程度,提供重置预言机(reset oracle)验证状态可恢复性,覆盖多物理引擎与多操作场景
时间轴 (近 90 天)
9月17日
REVERSAL-BENCH揭示当前主流无重置强化学习范式在很大程度上依赖底层环境的可逆性
待验证50%
9月17日
REVERSAL-BENCH引入了一个连续参数ρ∈[0,1]来控制环境的可逆程度
待验证50%
9月17日
REVERSAL-BENCH提供了一个基于真值的重置预言机(reset oracle),用于判断某个状态是否真正可以被恢复
待验证50%
9月17日
REVERSAL-BENCH的reset oracle依赖仿真器底层状态信息(如物体精确三维坐标、速度向量、接触约束)判断当前状态是否仍在可达初始分布的吸引域内
待验证50%
9月17日
REVERSAL-BENCH横跨五个物理引擎,覆盖八种操作设置
待验证50%
9月17日
许多在可逆环境中表现优异的算法一旦逼近不可逆临界点,性能可能断崖式下跌
待验证50%
全部知识事实 (6)
待验证
REVERSAL-BENCH揭示当前主流无重置强化学习范式在很大程度上依赖底层环境的可逆性
50%待验证REVERSAL-BENCH引入了一个连续参数ρ∈[0,1]来控制环境的可逆程度
50%待验证REVERSAL-BENCH提供了一个基于真值的重置预言机(reset oracle),用于判断某个状态是否真正可以被恢复
50%待验证REVERSAL-BENCH的reset oracle依赖仿真器底层状态信息(如物体精确三维坐标、速度向量、接触约束)判断当前状态是否仍在可达初始分布的吸引域内
50%待验证REVERSAL-BENCH横跨五个物理引擎,覆盖八种操作设置
50%待验证许多在可逆环境中表现优异的算法一旦逼近不可逆临界点,性能可能断崖式下跌
50%