Back to skills and projects

OpenClassrooms · P11 · Validated project

Training a LunarLander agent

Comparing PPO and DQN in simulation across multiple evaluation episodes.

StatePolicyReward

The work

Apprendre une politique d’atterrissage dans LunarLander, après des exercices introductifs, en comparant une baseline, PPO optimisé et DQN.

  • Les tutoriels du dépôt ne sont pas toute la mission : MISSION contient exploration, optimisation PPO, comparaison DQN et évaluation finale.
  • États, actions et récompenses sont explorés ; learning rate, gamma et n_steps sont ajustés ; une interface, une API, un dashboard et une vidéo sont référencés.

Available results

  • Sorties enregistrées : PPO final 247,0 ± 49,9 sur 100 épisodes ; 91/100 épisodes dépassent le seuil de récompense 200.
  • Le notebook de comparaison rapporte environ 243,7 pour PPO contre 115,0 pour DQN. Le document de questions/réponses affirmant que tous les DQN restent négatifs ne reflète pas ce résultat final.

Results and feedback preserved in the 9 October 2026 audit. They were not reproduced while preparing this portfolio.

What I take away

L’agent apprend par interaction et récompense : la comparaison doit inclure variabilité, budget d’entraînement et protocole d’évaluation.

Limitations and next steps
  • Le seuil reward > 200 est la définition de réussite utilisée par le projet, pas une preuve de sécurité physique.
  • Pas de démonstration multi-seed établie ni d’application hors simulation. Les écarts mesurent les épisodes du protocole, pas plusieurs entraînements indépendants.
Read the learning report