OpenClassrooms · P4 · Projet validé
Comprendre l’attrition
Comparer des classifieurs et expliquer leurs prédictions dans un contexte d’attrition.
Données→Classification→Explication
Le travail réalisé
Prédire le départ d’employés à partir de données RH, en tenant compte du déséquilibre de classes et du compromis entre détection et fausses alertes.
- Exploration et rapprochement de trois sources RH ; préparation des variables dans un pipeline ; comparaison de régression logistique, SVM, LightGBM, KNN et dummy.
- Sélection fondée sur la validation croisée ; analyse des métriques de classification et production d’un modèle exporté.
Les résultats disponibles
- Le notebook consulté rapporte pour la régression logistique une AUC CV d’environ 0,832 et une AUC test d’environ 0,788.
- Sur son split de 368 lignes, la matrice de confusion indique 31 vrais positifs et 17 faux négatifs : rappel de 31/48, soit environ 64,6 %. Ce résultat appartient à ce split, pas à toutes les versions du projet.
Résultats et retours conservés dans l’audit du 9 octobre 2026. Ils n’ont pas été reproduits lors de la préparation de ce portfolio.
Ce que j’en retiens
La performance n’est pas un pourcentage unique : un modèle peut avoir une AUC correcte et manquer encore une partie importante des départs.
Limites et pistes d’amélioration
- Le README de l’API P5 évoque un autre jeu de test : ne pas mélanger les chiffres des deux versions.
- Les facteurs SHAP doivent provenir du notebook ou du dashboard, sans reprendre automatiquement une liste générique du README.