Sign inSign up

markub3327/rl-toolkit

By markub3327

•Updated about 4 years ago

Toolkit for doing research in RL algorithms.

Image
0

3.7K

markub3327/rl-toolkit repository overview

⁠RL Toolkit

Release Tag Issues Commits Languages Size

⁠Papers

⁠Setting up container

# Preview
docker pull markub3327/rl-toolkit:latest

# Stable
docker pull markub3327/rl-toolkit:2.0.2

⁠Run

# Run learner's container
docker run -p 8000:8000 -it --rm markub3327/rl-toolkit

# Run tester's or agent's container
docker run -it --rm markub3327/rl-toolkit


# Learner container
python3 -m rl_toolkit -e [ENV_NAME] learner --db_server [IP_ADDRESS/HOSTNAME] -s [PATH_TO_MODEL] [--wandb] [-h]

# Agent container
python3 -m rl_toolkit -e [ENV_NAME] agent --db_server [IP_ADDRESS/HOSTNAME] [--wandb] [-h]

# Tester container
python3 -m rl_toolkit -e [ENV_NAME] tester --model_path [PATH_TO_MODEL] [--render] [--wandb] [-h]

⁠Tested environments

EnvironmentObservation spaceObservation boundsAction spaceAction bounds
BipedalWalkerHardcore-v3(24, )[-inf, inf](4, )[-1.0, 1.0]
Walker2DBulletEnv-v0(22, )[-inf, inf](6, )[-1.0, 1.0]
AntBulletEnv-v0(28, )[-inf, inf](8, )[-1.0, 1.0]
HalfCheetahBulletEnv-v0(26, )[-inf, inf](6, )[-1.0, 1.0]
HopperBulletEnv-v0(15, )[-inf, inf](3, )[-1.0, 1.0]
HumanoidBulletEnv-v0(44, )[-inf, inf](17, )[-1.0, 1.0]
MinitaurBulletEnv-v0(28, )[-167.72488, 167.72488](8, )[-1.0, 1.0]

⁠Results

EnvironmentSAC + gSDESAC + gSDE
+ Huber loss
TQC + gSDETQC + gSDE
+ Reverb
BipedalWalkerHardcore-v313 ± 18(2)⁠-228 ± 18(2)⁠-
Walker2DBulletEnv-v02270 ± 28(1)⁠2732 ± 962535 ± 94(2)⁠-
AntBulletEnv-v03106 ± 61(1)⁠3460 ± 1193700 ± 37(2)⁠-
HalfCheetahBulletEnv-v02945 ± 95(1)⁠3003 ± 2263041 ± 157(2)⁠-
HopperBulletEnv-v02515 ± 50(1)⁠2555 ± 4052401 ± 62(2)⁠-
HumanoidBulletEnv-v0----
MinitaurBulletEnv-v0----

Frameworks: Tensorflow, Reverb, OpenAI Gym, PyBullet, WanDB, OpenCV

Tag summary

Content type

Image

Digest

sha256:af88ebbf4…

Size

1.1 GB

Last updated

about 4 years ago

docker pull markub3327/rl-toolkit