hubert-ml/deep-rl-class-ppo-LunarLander-v3
022
1M itérations, mean_reward = 250, std_reward = 23
1M itérations, mean_reward = 250, std_reward = 23
initial commit
1M itérations, mean_reward = 250, std_reward = 23
1M itérations, mean_reward = 250, std_reward = 23
initial commit