OpenClassrooms · P14 · Validated project
Validation confirmed by Pierre on 11 October 2026. Detailed assessor feedback has not been rechecked.
Adapting a medical LLM
Comparing SFT and DPO and examining model limitations on an educational medical task.
Corpus→Adaptation→Evaluation
The work
Construire et évaluer un POC bilingue fondé sur un LLM adapté par SFT/LoRA, puis comparer une étape DPO et intégrer le modèle derrière un contrat de sortie et des garde-fous.
- Qwen3-1.7B-Base ; corpus de 4 700 paires FR/EN réparties en 3 721 apprentissages, 479 validations et 500 tests QA. Le corpus ne contient pas de labels de triage.
- SFT v39 à 150 étapes et DPO v41 à 20 étapes ; comparaison Base/SFT/DPO et réserve finale de 18 scénarios synthétiques.
Available results
- NLL sur les 479 validations : Base 1,532045 ; SFT 0,830098 ; DPO 0,828884. Cette baisse mesure l’apprentissage des réponses QA, pas l’exactitude d’une priorité médicale.
- Sur la réserve de 18 scénarios, le SFT brut donne 0/18 JSON conformes ; 17/18 générations atteignent 512 tokens. Des faits patient non étayés sont documentés.
Additional results and observations
- Le DPO n’a pas été retenu. Le résultat final est explicitement négatif pour une sortie de triage autonome fiable.
Results and feedback preserved in the 9 October 2026 audit. They were not reproduced while preparing this portfolio.
What I take away
Ce projet montre la capacité à reconnaître un résultat négatif et à limiter le rôle du modèle. La métrique d’entraînement et l’utilité de la tâche finale sont deux objets différents.
Limitations and next steps
- Scénarios synthétiques, pas une validation clinique. Une sortie JSON conforme obtenue avec des garde-fous ne prouve pas la correction de la décision.
- Le RAG est une ouverture proposée dans le contexte de soutenance, pas une fonctionnalité médicale livrée et évaluée.
- La disponibilité actuelle de l’inférence, les coûts effectifs et les performances sous charge ne sont pas vérifiés.