[控场AI]
产品

Roxie

基于JAX编写的开源强化学习框架,专注于MuJoCo环境下的连续控制任务,提供统一硬件接口、七种内置RL算法及全编译训练循环

时间轴 (近 90 天)

9月24日

Roxie 是一个完全基于 JAX 编写的强化学习框架,专门针对 MuJoCo 环境下的连续控制任务而设计

待验证50%
9月24日

Roxie 由开发者 Vittorio 在 Reddit 上发布

待验证50%
9月24日

Roxie 通过单一统一接口驱动 MuJoCo 的不同硬件路径,无论底层跑在 GPU 还是纯 CPU,开发者面对的都是同一套 API

待验证50%
9月24日

Roxie 内置了七种连续控制算法:DDPG、TD3、D4PG、TD4、SAC、MPO、PPO

待验证50%
9月24日

Roxie 中所有智能体都共享同一个 agent 基类,使算法差异收敛到最小的可插拔模块

待验证50%
9月24日

Roxie 将采样(acting)和学习(learning)两个阶段都编译成单个 XLA 程序,运行期间没有任何操作需要回到主机端处理

待验证50%
9月24日

Roxie 使用 5 亿步(500M-step)的训练预算,在 dm_control 的 3 个 humanoid 任务上测试了全部 7 个智能体,同时覆盖 GPU 和纯 CPU 两种运行单元

待验证50%
9月24日

Roxie 的预训练检查点已上传至 Hugging Face(vittorione/roxie-release-v1)

待验证50%
9月24日

Roxie 框架代码托管在 GitHub(github.com/vittorione94/roxie)上

待验证50%
9月24日

Roxie 聚焦在 MuJoCo 连续控制垂直方向,而非大而全的通用 RL 库

待验证50%

全部知识事实 (10)

来源文章