Back to skills and projects

OpenClassrooms · P12 · Validated project

Building a multimodal pipeline

Collecting and normalising heterogeneous sources in an orchestrated pipeline.

SourcesAirflowData

The work

Construire la chaîne d’acquisition et de préparation de données nécessaires à un futur détecteur multimodal de désinformation.

  • Le DAG relie quatre extracteurs — Fakeddit, Guardian, Snopes et LIAR — à la transformation, la construction du dataset, l’acquisition des images, le chargement PostgreSQL et le reporting des indicateurs.
  • Neuf tâches, planification quotidienne, limites de concurrence et retry documentés ; schéma Pydantic et standardisation des données.

Available results

  • Le jury valide extraction, transformation, stockage et indicateurs, et mentionne une démonstration live.
  • Aucun volume de run actuel, uptime Airflow ou performance d’un classifieur de fake news n’a été mesuré dans cet audit.

Results and feedback preserved in the 9 October 2026 audit. They were not reproduced while preparing this portfolio.

What I take away

La qualité du modèle futur dépend de la qualité et de la sémantique de ses données : provenance et absence de label sont des informations à conserver.

Limitations and next steps
  • LIAR est textuel ; toutes les lignes ne doivent pas être décrites comme paires texte/image.
  • Guardian ne fournit pas de label de vérité. La documentation doit éviter de confondre réputation éditoriale et annotation factuelle.
  • Un pipeline d’entraînement n’est pas un modèle de détection livré.
Read the learning report