CleanRL 安装与使用教程:三步跑通第一个强化学习实验

📅 发布时间:2026/9/16 21:42:07
CleanRL 安装与使用教程:三步跑通第一个强化学习实验
CleanRL 安装与使用教程三步跑通第一个强化学习实验【免费下载链接】cleanrlHigh-quality single file implementation of Deep Reinforcement Learning algorithms with research-friendly features (PPO, DQN, C51, DDPG, TD3, SAC, PPG)项目地址: https://gitcode.com/GitHub_Trending/cl/cleanrlCleanRL 是一个深度强化学习DRL让模型自己通过试错学会策略库把 PPO、DQN、C51、SAC、TD3 等算法各自封装成一个独立的 Python 文件。每个实现都极短PPO 的 Atari 版仅约 350 行适合想读懂算法完整逻辑、或快速改造做实验的开发者。三步跑起你的第一个 CleanRL 实验1. 克隆仓库并安装依赖CleanRL 要求 Python 3.8–3.10以及快速安装工具 uv0.7.9 以上。依次执行git clone https://gitcode.com/GitHub_Trending/cl/cleanrl.git cd cleanrl uv pip install .uv pip install .会按 pyproject.toml 装好 torch、gymnasium、tensorboard 等核心依赖不想用 uv 可以改执行pip install -r requirements/requirements.txt。这一步完成后终端无报错输出Python 里执行import torch能正常导入。2. 启动 PPO 训练uv run python cleanrl/ppo.py \ --seed 1 \ --env-id CartPole-v0 \ --total-timesteps 50000--seed是随机种子--env-id指定训练环境--total-timesteps指定训练预算。这一步完成后终端会每隔 25000 步打印一张episode / mean_reward表格奖励持续上升并逼近上限 500说明智能体已学会保持杆子直立。3. 用 TensorBoard 查看训练曲线日志会写入运行目录下的runs/文件夹。另开一个终端在同一目录下执行tensorboard --logdir runs这一步完成后浏览器打开终端打印的地址就能看到实时奖励曲线完成从启动到观察结果的完整闭环。读懂关键参数只改这几组所有参数都定义在各脚本的Args数据类中tyro 自动把它转成命令行接口执行python cleanrl/ppo.py --help可列出全部选项。常用的分三类参数作用什么时候需要改示例值--env-id训练所用的环境更换任务时MountainCar-v0--total-timesteps总训练步数即训练预算冒烟测试调小难任务调大50000--num-envs并行环境数量相当于同时开几局游戏想加快训练吞吐时8--learning-rate优化器学习率训练发散或收敛过慢时2.5e-4--clip-coefPPO 裁剪系数限制单步策略更新幅度策略波动过大时调小0.2--seed随机种子需要复现某次实验时1需要录像时加--capture-video视频保存在videos/目录要接入 WB 实验追踪先执行一次wandb login再在命令里追加--track --wandb-project-name myexp。逛一圈仓库核心代码、示例与工具链cleanrl/ # 核心代码一个算法一个文件如 ppo.py、dqn.py cleanrl_utils/ # 共用工具环境封装、绘图、超参搜索 tuner.py tests/ # 各算法测试可跑 pytest 验证环境装好 benchmark/ # 一键基准测试脚本shell/slurm 模板 docs/ # 文档站源码与各算法结果图 requirements/ # 按场景拆分的依赖atari、mujoco、jax 等 Dockerfile # 云端实验的容器镜像入口 cloud/ # AWS Batch 部署模板读代码从 cleanrl/ppo.py 开始即可环境构建、Agent 网络、PPO 更新循环全部在这一个文件里。避坑与进阶版本、依赖与云端部署Python 版本卡死torch 锁定 2.4.1用 3.11 及以上安装会直接报错先python --version确认。场景依赖按需装跑 Atari 才需要uv pip install .[atari]连续控制装.[mujoco]JAX 版装.[jax]不必全装。它不是可 import 的库CleanRL 是独立脚本合集官方明确不支持import想复用某个算法复制对应文件再改。超参搜索cleanrl_utils/tuner.py 基于 Optuna 自动搜索参数组合。云端部署仓库自带 Docker 与 AWS Batch 模板cloud/可把实验平移到集群。【免费下载链接】cleanrlHigh-quality single file implementation of Deep Reinforcement Learning algorithms with research-friendly features (PPO, DQN, C51, DDPG, TD3, SAC, PPG)项目地址: https://gitcode.com/GitHub_Trending/cl/cleanrl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考