PPO LunarLander-v3

使用 Stable-Baselines3 在 Gymnasium 的 LunarLander-v3 环境上训练的一个月球着陆器智能体(PPO 算法)。

环境

  • 环境:LunarLander-v3(Gymnasium / Box2D)
  • 动作空间:4 个离散动作(无操作 / 左引擎 / 主引擎 / 右引擎)
  • 状态空间:8 维连续观测

算法与超参数

超参数 值
算法 PPO(MlpPolicy)
gamma 0.999
总训练步数 1,500,000
并行环境数 16
n_steps 1024
学习率 3e-4

评估结果

  • 平均奖励:284.28 ± 29.55(100 局确定性评估)
  • 超过 LunarLander 「通关」标准(平均奖励 ≥ 200)

回放视频

观看回放视频

Downloads last month
19
Video Preview
loading