Cette formation intensive permet aux data engineers et data scientists de maîtriser le développement, l’optimisation de performance et le déploiement de modèles de Machine Learning distribués avec Spark ML.

VectorAssembler, régression et Tuning. CrossValidator et Diagnostic SparkUI.
Premier pipeline de classification distribuée avec SparkML
Contexte :
Vous venez d'intégrer l'équipe Data de "OmniShop" en tant que Data Scientist. Votre première tâche consiste à migrer un script prototype d'analyse de l'attrition client (churn), initialement développé en local avec Scikit-Learn, vers l'infrastructure Big Data de l'entreprise (Apache Spark) pour pouvoir traiter l'ensemble du fichier client historique (plusieurs giga-octets).
Votre mission
À l'aide d'un notebook d'initiation contenant la structure du code et des instructions claires (un "code à trous"), le professionnel doit :
1. Charger et explorer le dataset client (format CSV) sous forme de DataFrame Spark. 2. Préparer les données : Convertir les variables catégorielles avec StringIndexer et regrouper les variables prédictives dans un vecteur unique via VectorAssembler. 3. Entraîner le modèle : Instancier un algorithme de classification classique (Random Forest Classifier) et l'ajuster (fit) sur les données d'entraînement.
4. Évaluer : Générer des prédictions sur le jeu de test et calculer la métrique d'exactitude (Accuracy) avec le MulticlassClassificationEvaluator.
Modalités pédagogiques :
Vous avez 0,5 jour pour réaliser ce travail de migration et de configuration de votre premier pipeline ML distribué. Vous réaliserez ce travail en individuel. L'entraide est bienvenue pour surmonter les premières erreurs de syntaxe PySpark.
Modalités d'évaluation :
- Votre responsable technique (formateur) validera en individuel la bonne exécution et les résultats de votre notebook PySpark.
- Votre responsable technique animera une revue collective du code à partir d'un des livrables du groupe, tiré au hasard, pour consolider les bonnes pratiques SparkML.
Critères d'évaluation :
- Le notebook PySpark en local fonctionne correctement : l'environnement Spark est initialisé, le jeu de données client est chargé et le code s'exécute de bout en bout sans générer d'erreur. - Les données sont prêtes pour l'algorithme : l'indexation des catégories et la vectorisation des caractéristiques sont appliquées de manière conforme, les données textuelles sont converties en valeurs numériques exploitables par SparkML.
- Le modèle est entraîné et évalué : l'algorithme Random Forest est correctement ajusté sur les données d'entraînement et la métrique d'exactitude (Accuracy) finale s'affiche de manière lisible en sortie du notebook.
Livrables :
Le Notebook PySpark complété (churn_classification_spark.ipynb)
✓ Développer des modèles ML distribués
✓ Optimiser les performances de calcul
✓ Préparer et transformer des données pour ML
✓ Évaluer et déployer les modèles
3 jours
Tarif intra-entreprise : sur demande
Data engineers, data scientists
Connaissances en Python/Scala, Spark et ML.
70% pratique
Cas d’usage professionnels
Ateliers pratiques
Si vous êtes en situation de handicap, il est possible de mettre en place des aménagements