Retour aux compétences et aux projets

OpenClassrooms · P12 · Projet validé

Construire un pipeline multimodal

Collecter et normaliser des sources hétérogènes dans un pipeline orchestré.

SourcesAirflowDonnées

Le travail réalisé

Construire la chaîne d’acquisition et de préparation de données nécessaires à un futur détecteur multimodal de désinformation.

  • Le DAG relie quatre extracteurs — Fakeddit, Guardian, Snopes et LIAR — à la transformation, la construction du dataset, l’acquisition des images, le chargement PostgreSQL et le reporting des indicateurs.
  • Neuf tâches, planification quotidienne, limites de concurrence et retry documentés ; schéma Pydantic et standardisation des données.

Les résultats disponibles

  • Le jury valide extraction, transformation, stockage et indicateurs, et mentionne une démonstration live.
  • Aucun volume de run actuel, uptime Airflow ou performance d’un classifieur de fake news n’a été mesuré dans cet audit.

Résultats et retours conservés dans l’audit du 9 octobre 2026. Ils n’ont pas été reproduits lors de la préparation de ce portfolio.

Ce que j’en retiens

La qualité du modèle futur dépend de la qualité et de la sémantique de ses données : provenance et absence de label sont des informations à conserver.

Limites et pistes d’amélioration
  • LIAR est textuel ; toutes les lignes ne doivent pas être décrites comme paires texte/image.
  • Guardian ne fournit pas de label de vérité. La documentation doit éviter de confondre réputation éditoriale et annotation factuelle.
  • Un pipeline d’entraînement n’est pas un modèle de détection livré.
Lire le bilan du parcours