Retour aux compétences et aux projets

OpenClassrooms · P11 · Projet validé

Entraîner un agent LunarLander

Comparer PPO et DQN dans une simulation, avec une évaluation sur plusieurs épisodes.

ÉtatPolitiqueRécompense

Le travail réalisé

Apprendre une politique d’atterrissage dans LunarLander, après des exercices introductifs, en comparant une baseline, PPO optimisé et DQN.

  • Les tutoriels du dépôt ne sont pas toute la mission : MISSION contient exploration, optimisation PPO, comparaison DQN et évaluation finale.
  • États, actions et récompenses sont explorés ; learning rate, gamma et n_steps sont ajustés ; une interface, une API, un dashboard et une vidéo sont référencés.

Les résultats disponibles

  • Sorties enregistrées : PPO final 247,0 ± 49,9 sur 100 épisodes ; 91/100 épisodes dépassent le seuil de récompense 200.
  • Le notebook de comparaison rapporte environ 243,7 pour PPO contre 115,0 pour DQN. Le document de questions/réponses affirmant que tous les DQN restent négatifs ne reflète pas ce résultat final.

Résultats et retours conservés dans l’audit du 9 octobre 2026. Ils n’ont pas été reproduits lors de la préparation de ce portfolio.

Ce que j’en retiens

L’agent apprend par interaction et récompense : la comparaison doit inclure variabilité, budget d’entraînement et protocole d’évaluation.

Limites et pistes d’amélioration
  • Le seuil reward > 200 est la définition de réussite utilisée par le projet, pas une preuve de sécurité physique.
  • Pas de démonstration multi-seed établie ni d’application hors simulation. Les écarts mesurent les épisodes du protocole, pas plusieurs entraînements indépendants.
Lire le bilan du parcours