Transformez vos pipelines de données en workflows fiables et supervisés avec Airflow, la plateforme de référence pour orchestrer l'ETL à l'échelle. En deux jours, vous apprendrez à construire des DAGs robustes, à gérer les pannes sans perdre de données et à mettre en place des alertes pour que votre infrastructure tourne sans surprises.

Contexte :
Vous venez d'intégrer l'équipe Data Ops d'une FinTech en tant que Data Engineer. L'entreprise s'appuie sur Apache Airflow pour orchestrer la synchronisation quotidienne des transactions clients vers un Data Warehouse. Récemment, des coupures réseau intermittentes avec l'API bancaire ont causé des échecs critiques qui n'ont pas été détectés à temps, faussant les rapports financiers du matin. Votre responsable technique vous confie la mission de sécuriser ce pipeline existant et d'automatiser sa surveillance.
Votre mission est de :
- Télécharger le code source du DAG initial fourni par l'équipe technique (basé sur un BashOperator).
- Modifier la structure du DAG pour y intégrer un nouvel opérateur (PythonOperator) chargé d'exécuter un script de nettoyage des données.
- Configurer une politique de tolérance aux pannes sur le DAG en définissant des tentatives d'exécution automatiques globales et spécifiques (retries et retry_delay).
- Mettre en place un mécanisme d'alerte automatique en configurant l'argument on_failure_callback pour notifier l'équipe technique en cas d'échec persistant (simulation via une fonction Python de log dédiée).
- Simuler une panne technique (erreur d'URL ou de variable) afin de valider visuellement le comportement des relances et le déclenchement de l'alerte
À l’issue de la formation, le stagiaire sera capable d’orchestrer et superviser des pipelines de données.
2 jours
Tarif inter-entreprises : 1 440,00 € / participant
Tarif intra-entreprise : sur demande
Data engineers, DevOps.
Connaissances en Python, ETL.
- Créer et planifier des DAGs.
- Superviser et gérer les workflows.
- Automatiser des tâches répétitives.
Vous disposez de 4 heures pour réaliser ce travail d'adaptation et de sécurisation du workflow. Vous réaliserez ce travail de manière individuelle sur votre environnement local. L'entraide et le partage de bonnes pratiques via le canal de communication de la session sont vivement encouragés.
Modalités d'évaluation :
- Votre responsable technique (formateur) validera en individuel la conformité de votre code Python et la structure de votre DAG.
- Le formateur animera une revue collective du code à partir de l'un des livrables du groupe tiré au hasard, afin d'analyser la pertinence des paramètres de relance choisis.
Critères d'évaluation :
- Intégration technique réussie : Le DAG révisé se charge sans erreur de syntaxe dans l'interface UI d'Airflow et l'enchaînement entre le BashOperator et le PythonOperator respecte l'ordre logique attendu.
- Résilience effective : Les logs d'Airflow prouvent que le système tente de rejouer la tâche défaillante selon les intervalles définis avant de basculer en statut "failed".
- Supervision active : La fonction d'alerte (callback) s'exécute correctement et écrit le message d'erreur attendu lorsque la tâche échoue définitivement.
Livrables :
- Le fichier de code Python mis à jour contenant la structure du DAG (.py).
- Une capture d'écran de la vue "Grid" ou "Graph" de l'interface d'Airflow démontrant le comportement du pipeline lors de la simulation de panne (statuts up_for_retry ou failed avec exécution du callback).
Si vous êtes en situation de handicap, il est possible de mettre en place des aménagements.