Toolkit for doing research in RL algorithms.
3.7K
# Preview
docker pull markub3327/rl-toolkit:latest
# Stable
docker pull markub3327/rl-toolkit:2.0.2
# Run learner's container
docker run -p 8000:8000 -it --rm markub3327/rl-toolkit
# Run tester's or agent's container
docker run -it --rm markub3327/rl-toolkit
# Learner container
python3 -m rl_toolkit -e [ENV_NAME] learner --db_server [IP_ADDRESS/HOSTNAME] -s [PATH_TO_MODEL] [--wandb] [-h]
# Agent container
python3 -m rl_toolkit -e [ENV_NAME] agent --db_server [IP_ADDRESS/HOSTNAME] [--wandb] [-h]
# Tester container
python3 -m rl_toolkit -e [ENV_NAME] tester --model_path [PATH_TO_MODEL] [--render] [--wandb] [-h]
| Environment | Observation space | Observation bounds | Action space | Action bounds |
|---|---|---|---|---|
| BipedalWalkerHardcore-v3 | (24, ) | [-inf, inf] | (4, ) | [-1.0, 1.0] |
| Walker2DBulletEnv-v0 | (22, ) | [-inf, inf] | (6, ) | [-1.0, 1.0] |
| AntBulletEnv-v0 | (28, ) | [-inf, inf] | (8, ) | [-1.0, 1.0] |
| HalfCheetahBulletEnv-v0 | (26, ) | [-inf, inf] | (6, ) | [-1.0, 1.0] |
| HopperBulletEnv-v0 | (15, ) | [-inf, inf] | (3, ) | [-1.0, 1.0] |
| HumanoidBulletEnv-v0 | (44, ) | [-inf, inf] | (17, ) | [-1.0, 1.0] |
| MinitaurBulletEnv-v0 | (28, ) | [-167.72488, 167.72488] | (8, ) | [-1.0, 1.0] |
| Environment | SAC + gSDE | SAC + gSDE + Huber loss | TQC + gSDE | TQC + gSDE + Reverb |
|---|---|---|---|---|
| BipedalWalkerHardcore-v3 | 13 ± 18(2) | - | 228 ± 18(2) | - |
| Walker2DBulletEnv-v0 | 2270 ± 28(1) | 2732 ± 96 | 2535 ± 94(2) | - |
| AntBulletEnv-v0 | 3106 ± 61(1) | 3460 ± 119 | 3700 ± 37(2) | - |
| HalfCheetahBulletEnv-v0 | 2945 ± 95(1) | 3003 ± 226 | 3041 ± 157(2) | - |
| HopperBulletEnv-v0 | 2515 ± 50(1) | 2555 ± 405 | 2401 ± 62(2) | - |
| HumanoidBulletEnv-v0 | - | - | - | - |
| MinitaurBulletEnv-v0 | - | - | - | - |
Frameworks: Tensorflow, Reverb, OpenAI Gym, PyBullet, WanDB, OpenCV
Content type
Image
Digest
sha256:af88ebbf4…
Size
1.1 GB
Last updated
about 4 years ago
docker pull markub3327/rl-toolkit