OpenClassrooms · P11 · Projet validé
Entraîner un agent LunarLander
Comparer PPO et DQN dans une simulation, avec une évaluation sur plusieurs épisodes.
État→Politique→Récompense
Le travail réalisé
Apprendre une politique d’atterrissage dans LunarLander, après des exercices introductifs, en comparant une baseline, PPO optimisé et DQN.
- Les tutoriels du dépôt ne sont pas toute la mission : MISSION contient exploration, optimisation PPO, comparaison DQN et évaluation finale.
- États, actions et récompenses sont explorés ; learning rate, gamma et n_steps sont ajustés ; une interface, une API, un dashboard et une vidéo sont référencés.
Les résultats disponibles
- Sorties enregistrées : PPO final 247,0 ± 49,9 sur 100 épisodes ; 91/100 épisodes dépassent le seuil de récompense 200.
- Le notebook de comparaison rapporte environ 243,7 pour PPO contre 115,0 pour DQN. Le document de questions/réponses affirmant que tous les DQN restent négatifs ne reflète pas ce résultat final.
Résultats et retours conservés dans l’audit du 9 octobre 2026. Ils n’ont pas été reproduits lors de la préparation de ce portfolio.
Ce que j’en retiens
L’agent apprend par interaction et récompense : la comparaison doit inclure variabilité, budget d’entraînement et protocole d’évaluation.
Limites et pistes d’amélioration
- Le seuil reward > 200 est la définition de réussite utilisée par le projet, pas une preuve de sécurité physique.
- Pas de démonstration multi-seed établie ni d’application hors simulation. Les écarts mesurent les épisodes du protocole, pas plusieurs entraînements indépendants.