OpenClassrooms · P14 · Projet validé
Validation confirmée par Pierre le 11 octobre 2026. Le retour détaillé du jury n’a pas été relu.
Adapter un LLM médical
Comparer SFT et DPO, puis analyser les limites d’un modèle sur une tâche médicale pédagogique.
Corpus→Adaptation→Évaluation
Le travail réalisé
Construire et évaluer un POC bilingue fondé sur un LLM adapté par SFT/LoRA, puis comparer une étape DPO et intégrer le modèle derrière un contrat de sortie et des garde-fous.
- Qwen3-1.7B-Base ; corpus de 4 700 paires FR/EN réparties en 3 721 apprentissages, 479 validations et 500 tests QA. Le corpus ne contient pas de labels de triage.
- SFT v39 à 150 étapes et DPO v41 à 20 étapes ; comparaison Base/SFT/DPO et réserve finale de 18 scénarios synthétiques.
Les résultats disponibles
- NLL sur les 479 validations : Base 1,532045 ; SFT 0,830098 ; DPO 0,828884. Cette baisse mesure l’apprentissage des réponses QA, pas l’exactitude d’une priorité médicale.
- Sur la réserve de 18 scénarios, le SFT brut donne 0/18 JSON conformes ; 17/18 générations atteignent 512 tokens. Des faits patient non étayés sont documentés.
Autres résultats et observations
- Le DPO n’a pas été retenu. Le résultat final est explicitement négatif pour une sortie de triage autonome fiable.
Résultats et retours conservés dans l’audit du 9 octobre 2026. Ils n’ont pas été reproduits lors de la préparation de ce portfolio.
Ce que j’en retiens
Ce projet montre la capacité à reconnaître un résultat négatif et à limiter le rôle du modèle. La métrique d’entraînement et l’utilité de la tâche finale sont deux objets différents.
Limites et pistes d’amélioration
- Scénarios synthétiques, pas une validation clinique. Une sortie JSON conforme obtenue avec des garde-fous ne prouve pas la correction de la décision.
- Le RAG est une ouverture proposée dans le contexte de soutenance, pas une fonctionnalité médicale livrée et évaluée.
- La disponibilité actuelle de l’inférence, les coûts effectifs et les performances sous charge ne sont pas vérifiés.