Data - Avancé

Apache Spark avancé : traitement Big Data

À l’issue de la formation, le stagiaire sera capable de traiter et optimiser de grands volumes de données.

Programme

  • Introduire les fondamentaux de la formation et la mise en place de la veille technologique
  • Réaliser le travail de veille #1 sur les moteurs natifs et le calcul GPU
  • Réaliser le travail de veille #2 sur l'observabilité cloud native
  • Concevoir des architectures distribuées et paralléliser les flux massifs
  • Optimiser l'allocation des ressources et résoudre les goulots d'étranglement réseau
  • Implémenter la télémétrie et diagnostiquer les pannes
  • Profiler les applications Big Data en production
  • Maîtriser l'abstraction de données distribuées et les graphes d'exécution acycliques
  • Appliquer l'évaluation paresseuse et le partitionnement logique de données
  • Gérer la distribution de charge et les transferts inter-nœuds
  • Configurer les stratégies d'allocation mémoire vive et d'optimisation des plans de requêtes
  • Appliquer les algorithmes de lissage des asymétries de données
  • Collecter les métriques d'exécution distribuée
  • Analyser les goulots d'étranglement physiques et les incohérences de distribution
  • Implémenter les stratégies de mise en cache et de persistance en mémoire
  • Formaliser et analyser les apprentissages réalisés
  • Objectifs pédagogiques

    - Optimiser les traitements Spark.

    - Utiliser les RDD et DataFrame efficacement.

    - Gérer les ressources et la parallélisation.

    - Déboguer et profiler des applications Big Data.

    Durée et format

    3 jours

    Formation synchrone en téléprésentiel

    Tarifs

    Tarif inter-entreprises : 2 250 € / participant

    Tarif intra-entreprise : sur demande

    Publics

    Data engineers, data scientists.

    Pré-requis

    Connaissances en Python/Scala, SQL et Big Data.

    Modalités pédagogiques

    Vous avez 1 jour pour réaliser ce travail d'optimisation et de gestion des ressources. Vous réaliserez ce travail en binôme. L'entraide entre les différents groupes est bienvenue.

    Modalités et critères d'évaluation

    Modalités d'évaluation

    • votre responsable technique (formateur) validera en binôme la stabilité de votre traitement et la réduction de l'empreinte mémoire sur le cluster.
    • votre responsable technique animera une review collective de la stratégie de tuning à partir d'un des livrables du groupe, tiré au hasard.

    Critères d'évaluation

    • La consommation mémoire est maîtrisée : le script s'exécute de bout en bout sans lever d'alerte de saturation ou d'effondrement des nœuds du cluster.
    • Le transfert réseau est minimisé : le volume de données échangées lors des phases de regroupement est drastiquement réduit grâce aux jointures optimisées.
    • La charge est équilibrée : la durée d'exécution des tâches est homogène sur l'ensemble des unités de calcul, prouvant la disparition des goulets d'étranglement de distribution.

    Livrables

    • le code applicatif mis à jour (.py ou .scala) incluant les optimisations de requêtes et les stratégies de jointure explicites
    • le fichier de configuration du gestionnaire de ressources (.conf ou .sh) contenant le paramétrage affiné de la mémoire et des unités de calcul
    • les captures d'écran des indicateurs de l'interface de télémétrie prouvant l'équilibrage des tâches et la baisse des volumes de transfert réseau

    Handicap

    Si vous êtes en situation de handicap, il est possible de mettre en place des aménagements.

    Sessions

    Prochaine session le 2 Décembre 2026.

    Cette formation vous intéresse ?
    Contactez-nous pour échanger sur votre projet de formation.