LalithKumarRaju/MLAgents-Pyramids
052
PPO Agent playing ML-Agents-Pyramids
This model was trained as part of the ๐ค Hugging Face Deep Reinforcement Learning Course by Lalith Kumar Raju (LalithKumarRaju).
Evaluation Results
- Environment:
ML-Agents-Pyramids - Mean Reward:
1.80 +/- 0.20 - Baseline Requirement: $\ge -100$
Description
This repository contains the trained weights, configuration files, and evaluation metadata for Unit 5 P2.
