Roxie
基于JAX编写的开源强化学习框架,专注于MuJoCo环境下的连续控制任务,提供统一硬件接口、七种内置RL算法及全编译训练循环
时间轴 (近 90 天)
Roxie 是一个完全基于 JAX 编写的强化学习框架,专门针对 MuJoCo 环境下的连续控制任务而设计
Roxie 由开发者 Vittorio 在 Reddit 上发布
Roxie 通过单一统一接口驱动 MuJoCo 的不同硬件路径,无论底层跑在 GPU 还是纯 CPU,开发者面对的都是同一套 API
Roxie 内置了七种连续控制算法:DDPG、TD3、D4PG、TD4、SAC、MPO、PPO
Roxie 中所有智能体都共享同一个 agent 基类,使算法差异收敛到最小的可插拔模块
Roxie 将采样(acting)和学习(learning)两个阶段都编译成单个 XLA 程序,运行期间没有任何操作需要回到主机端处理
Roxie 使用 5 亿步(500M-step)的训练预算,在 dm_control 的 3 个 humanoid 任务上测试了全部 7 个智能体,同时覆盖 GPU 和纯 CPU 两种运行单元
Roxie 的预训练检查点已上传至 Hugging Face(vittorione/roxie-release-v1)
Roxie 框架代码托管在 GitHub(github.com/vittorione94/roxie)上
Roxie 聚焦在 MuJoCo 连续控制垂直方向,而非大而全的通用 RL 库
全部知识事实 (10)
Roxie 聚焦在 MuJoCo 连续控制垂直方向,而非大而全的通用 RL 库
50%待验证Roxie 框架代码托管在 GitHub(github.com/vittorione94/roxie)上
50%待验证Roxie 是一个完全基于 JAX 编写的强化学习框架,专门针对 MuJoCo 环境下的连续控制任务而设计
50%待验证Roxie 通过单一统一接口驱动 MuJoCo 的不同硬件路径,无论底层跑在 GPU 还是纯 CPU,开发者面对的都是同一套 API
50%待验证Roxie 内置了七种连续控制算法:DDPG、TD3、D4PG、TD4、SAC、MPO、PPO
50%待验证Roxie 中所有智能体都共享同一个 agent 基类,使算法差异收敛到最小的可插拔模块
50%待验证Roxie 将采样(acting)和学习(learning)两个阶段都编译成单个 XLA 程序,运行期间没有任何操作需要回到主机端处理
50%待验证Roxie 使用 5 亿步(500M-step)的训练预算,在 dm_control 的 3 个 humanoid 任务上测试了全部 7 个智能体,同时覆盖 GPU 和纯 CPU 两种运行单元
50%待验证Roxie 由开发者 Vittorio 在 Reddit 上发布
50%待验证Roxie 的预训练检查点已上传至 Hugging Face(vittorione/roxie-release-v1)
50%