Back to skills and projects

OpenClassrooms · P14 · Validated project

Validation confirmed by Pierre on 11 October 2026. Detailed assessor feedback has not been rechecked.

Adapting a medical LLM

Comparing SFT and DPO and examining model limitations on an educational medical task.

CorpusAdaptationEvaluation

The work

Construire et évaluer un POC bilingue fondé sur un LLM adapté par SFT/LoRA, puis comparer une étape DPO et intégrer le modèle derrière un contrat de sortie et des garde-fous.

  • Qwen3-1.7B-Base ; corpus de 4 700 paires FR/EN réparties en 3 721 apprentissages, 479 validations et 500 tests QA. Le corpus ne contient pas de labels de triage.
  • SFT v39 à 150 étapes et DPO v41 à 20 étapes ; comparaison Base/SFT/DPO et réserve finale de 18 scénarios synthétiques.

Available results

  • NLL sur les 479 validations : Base 1,532045 ; SFT 0,830098 ; DPO 0,828884. Cette baisse mesure l’apprentissage des réponses QA, pas l’exactitude d’une priorité médicale.
  • Sur la réserve de 18 scénarios, le SFT brut donne 0/18 JSON conformes ; 17/18 générations atteignent 512 tokens. Des faits patient non étayés sont documentés.
Additional results and observations
  • Le DPO n’a pas été retenu. Le résultat final est explicitement négatif pour une sortie de triage autonome fiable.

Results and feedback preserved in the 9 October 2026 audit. They were not reproduced while preparing this portfolio.

What I take away

Ce projet montre la capacité à reconnaître un résultat négatif et à limiter le rôle du modèle. La métrique d’entraînement et l’utilité de la tâche finale sont deux objets différents.

Limitations and next steps
  • Scénarios synthétiques, pas une validation clinique. Une sortie JSON conforme obtenue avec des garde-fous ne prouve pas la correction de la décision.
  • Le RAG est une ouverture proposée dans le contexte de soutenance, pas une fonctionnalité médicale livrée et évaluée.
  • La disponibilité actuelle de l’inférence, les coûts effectifs et les performances sous charge ne sont pas vérifiés.
Read the learning report