OpenClassrooms · P12 · Validated project
Building a multimodal pipeline
Collecting and normalising heterogeneous sources in an orchestrated pipeline.
Sources→Airflow→Data
The work
Construire la chaîne d’acquisition et de préparation de données nécessaires à un futur détecteur multimodal de désinformation.
- Le DAG relie quatre extracteurs — Fakeddit, Guardian, Snopes et LIAR — à la transformation, la construction du dataset, l’acquisition des images, le chargement PostgreSQL et le reporting des indicateurs.
- Neuf tâches, planification quotidienne, limites de concurrence et retry documentés ; schéma Pydantic et standardisation des données.
Available results
- Le jury valide extraction, transformation, stockage et indicateurs, et mentionne une démonstration live.
- Aucun volume de run actuel, uptime Airflow ou performance d’un classifieur de fake news n’a été mesuré dans cet audit.
Results and feedback preserved in the 9 October 2026 audit. They were not reproduced while preparing this portfolio.
What I take away
La qualité du modèle futur dépend de la qualité et de la sémantique de ses données : provenance et absence de label sont des informations à conserver.
Limitations and next steps
- LIAR est textuel ; toutes les lignes ne doivent pas être décrites comme paires texte/image.
- Guardian ne fournit pas de label de vérité. La documentation doit éviter de confondre réputation éditoriale et annotation factuelle.
- Un pipeline d’entraînement n’est pas un modèle de détection livré.