OpenClassrooms · P10 · Projet validé
Apprendre avec peu de labels
Explorer la classification d’IRM en mobilisant embeddings et semi-supervision.
IRM→Embeddings→Labels
Le travail réalisé
Exploiter un petit ensemble d’IRM labellisées et un ensemble non labellisé pour comparer des stratégies de classification et de semi-supervision.
- Dataset documenté de 1 506 images : 100 labels forts et 1 406 images non labellisées ; 50 labels forts pour l’apprentissage et 50 pour l’évaluation du protocole.
- Embeddings ResNet-18/ImageNet et comparaison avec ResNet-50/RadImageNet ; clustering, propagation de labels, self-training et entraînement des têtes de classification.
Les résultats disponibles
- Le notebook rapporte notamment un F5 d’environ 0,954 pour la stratégie C, avec rappel 0,96 et accuracy 0,88 sur le protocole documenté.
- Une variante RadImageNet atteint un rappel de 1 avec une précision de 0,625 et une accuracy de 0,70. Ces chiffres ne constituent pas une validation clinique.
Résultats et retours conservés dans l’audit du 9 octobre 2026. Ils n’ont pas été reproduits lors de la préparation de ce portfolio.
Ce que j’en retiens
Une performance élevée ne remplace pas un protocole indépendant. La distinction validation/test et le statut transductif font partie de l’explication scientifique.
Limites et pistes d’amélioration
- Les features des exemples dits test participent au traitement transductif sans leurs labels ; cela doit être explicitement distingué d’une évaluation sur données nouvelles.
- Le même jeu dit test sert à comparer des configurations et à suivre les epochs, avec affichage du meilleur F5 test : il n’est pas un test final indépendant.
- 50 images et l’absence de validation externe ne permettent pas de conclure sur la généralisation clinique.