OpenClassrooms · P11 · Validated project
Training a LunarLander agent
Comparing PPO and DQN in simulation across multiple evaluation episodes.
State→Policy→Reward
The work
Apprendre une politique d’atterrissage dans LunarLander, après des exercices introductifs, en comparant une baseline, PPO optimisé et DQN.
- Les tutoriels du dépôt ne sont pas toute la mission : MISSION contient exploration, optimisation PPO, comparaison DQN et évaluation finale.
- États, actions et récompenses sont explorés ; learning rate, gamma et n_steps sont ajustés ; une interface, une API, un dashboard et une vidéo sont référencés.
Available results
- Sorties enregistrées : PPO final 247,0 ± 49,9 sur 100 épisodes ; 91/100 épisodes dépassent le seuil de récompense 200.
- Le notebook de comparaison rapporte environ 243,7 pour PPO contre 115,0 pour DQN. Le document de questions/réponses affirmant que tous les DQN restent négatifs ne reflète pas ce résultat final.
Results and feedback preserved in the 9 October 2026 audit. They were not reproduced while preparing this portfolio.
What I take away
L’agent apprend par interaction et récompense : la comparaison doit inclure variabilité, budget d’entraînement et protocole d’évaluation.
Limitations and next steps
- Le seuil reward > 200 est la définition de réussite utilisée par le projet, pas une preuve de sécurité physique.
- Pas de démonstration multi-seed établie ni d’application hors simulation. Les écarts mesurent les épisodes du protocole, pas plusieurs entraînements indépendants.