Intelligence Artificielle - Débutant

Machine Learning distribué avec Spark ML

Cette formation intensive permet aux data engineers et data scientists de maîtriser le développement, l’optimisation de performance et le déploiement de modèles de Machine Learning distribués avec Spark ML.

Programme de la formation

JOUR 1 - Pipelines & Classification Distribuée

  • Mise en pratique (Brief 1) :
    • Migration d'un script local vers l'infrastructure Big Data Spark (traitement du churn client).  
    • Préparation, vectorisation et entraînement d'un premier pipeline de classification.  
  • Notions clés : VectorAssembler, régression et Tuning.  

JOUR 2 - Optimisation & Diagnostic de Performance

  • Veille : Prévention du Data leakage dans les pipelines ML.  
  • Mise en pratique (Brief 2) :
    • Optimisation d’un modèle de prévision de ventes à grande échelle.  
    • Analyse des goulots d'étranglement et diagnostic de calculs distribués.  
  • Notions clés : Coût du CrossValidator et Diagnostic SparkUI.  

JOUR 3 - Système de Recommandation & Industrialisation

  • Veille : Formats de stockage optimisés pour le Big Data.  
  • Mise en pratique (Brief 3) :
    • Audit, optimisation de performance et industrialisation d’un système de recommandation.  
  • Notions clés & Bilan : Évaluation des modèles, déploiement distribué et formalisation des acquis.  
  • Focus Technique & Bilan : Inférence haute performance, validation des livrables et bilan réflexif

Exemple de mise en situation 

Premier pipeline de classification distribuée avec SparkML 

Contexte : 

Vous venez d'intégrer l'équipe Data de "OmniShop" en tant que Data Scientist. Votre première tâche consiste à migrer un script prototype d'analyse de l'attrition client (churn), initialement développé en local avec Scikit-Learn, vers l'infrastructure Big Data de l'entreprise (Apache Spark) pour pouvoir traiter l'ensemble du fichier client historique (plusieurs giga-octets). 

Votre mission 

À l'aide d'un notebook d'initiation contenant la structure du code et des instructions claires (un "code à trous"), le professionnel doit :

1. Charger et explorer le dataset client (format CSV) sous forme de DataFrame Spark. 2. Préparer les données : Convertir les variables catégorielles avec StringIndexer et regrouper les variables prédictives dans un vecteur unique via VectorAssembler. 3. Entraîner le modèle : Instancier un algorithme de classification classique (Random Forest Classifier) et l'ajuster (fit) sur les données d'entraînement. 

4. Évaluer : Générer des prédictions sur le jeu de test et calculer la métrique d'exactitude (Accuracy) avec le MulticlassClassificationEvaluator. 

Modalités pédagogiques : 

Vous avez 0,5 jour pour réaliser ce travail de migration et de configuration de votre premier pipeline ML distribué. Vous réaliserez ce travail en individuel. L'entraide est bienvenue pour surmonter les premières erreurs de syntaxe PySpark. 

Modalités d'évaluation : 

- Votre responsable technique (formateur) validera en individuel la bonne exécution et les résultats de votre notebook PySpark. 

- Votre responsable technique animera une revue collective du code à partir d'un des livrables du groupe, tiré au hasard, pour consolider les bonnes pratiques SparkML. 

Critères d'évaluation : 

- Le notebook PySpark en local fonctionne correctement : l'environnement Spark est initialisé, le jeu de données client est chargé et le code s'exécute de bout en bout sans générer d'erreur. - Les données sont prêtes pour l'algorithme : l'indexation des catégories et la vectorisation des caractéristiques sont appliquées de manière conforme, les données textuelles sont converties en valeurs numériques exploitables par SparkML. 

- Le modèle est entraîné et évalué : l'algorithme Random Forest est correctement ajusté sur les données d'entraînement et la métrique d'exactitude (Accuracy) finale s'affiche de manière lisible en sortie du notebook. 

Livrables : 

Le Notebook PySpark complété (churn_classification_spark.ipynb)

Compétences visées

Développer des modèles ML distribués 

Optimiser les performances de calcul 

Préparer et transformer des données pour ML 

Évaluer et déployer les modèles

Durée & Format

3 jours

Tarif de la formation

Tarif intra-entreprise : sur demande

Public

Data engineers, data scientists 

Prérequis

Connaissances en Python/Scala, Spark et ML.

Pédagogie et techniques

70% pratique

Cas d’usage professionnels

Modalités d’évaluation

Ateliers pratiques

Handicap

Si vous êtes en situation de handicap, il est possible de mettre en place des aménagements

Cette formation vous intéresse ? 
Contactez-nous pour échanger sur votre projet de formation.