TRL(Transformer Reinforcement Learning)是 HuggingFace 出品的大语言模型微调与对齐训练库,支持 SFT、DPO、PPO、GRPO 等主流训练范式。
docker build -t oc9-trl:1.0.0 .
# 验证版本
docker run --rm oc9-trl:1.0.0 python3.11 -c "import importlib.metadata; print(importlib.metadata.version('trl'))"
# 运行基础测试(在版本目录下执行)
bash test.sh oc9-trl:1.0.0
无
Content type
Image
Digest
sha256:ad2c805fe…
Size
465.6 MB
Last updated
4 months ago
docker pull ocpub/oc9-trl:1.0.0