Cette formation intensive permet aux data scientists de maîtriser l’automatisation de la création, de l’évaluation et du déploiement de modèles de Machine Learning avec H2O.ai.

La formation se déroule sur 2 jours et s’articule autour de plusieurs mises en situation pratiques.
Jour 1
Jour 2
Optimisation fine et arbitrage des modèles via le Leaderboard H2O
Contexte :
L'entreprise de prêt-à-porter en ligne "Mod'Express" fait face à une augmentation anormale du taux de désabonnement (churn) de ses clients Premium. Un premier modèle prédictif a été lancé à la va-vite en utilisant les paramètres par défaut de H2O AutoML.
Le problème ? Le modèle désigné "Leader" par l'outil affiche un score d'AUC parfait sur les données d'entraînement, mais s'effondre complètement lors des tests en conditions réelles. De plus, son temps de calcul actuel est beaucoup trop long pour les capacités du serveur de l'entreprise.
En tant que Data Scientist Senior, vous reprenez la main sur l'algorithme, en reconfigurant finement le processus d'AutoML pour éviter le surapprentissage (overfitting), et de rédiger une note d'arbitrage pour la direction technique afin de choisir le modèle le plus robuste et industrialisable.
Votre mission est de :
- Reconfigurer et brider l'AutoML : Mettre en place des contraintes strictes dans le script Python (max_runtime_secs, max_models, exclusion des algorithmes trop lourds comme les Deep Learning complexes si nécessaire).
- Piloter la validation croisée (Cross-Validation) : Configurer les paramètres de N-fold cross-validation pour obtenir des métriques de performance réalistes et non biaisées.
- Explorer et décortiquer le Leaderboard : Extraire le tableau des scores H2O et analyser les métriques clés (AUC, LogLoss, RMSE, mean_per_class_error) au-delà du simple classement par défaut.
- Diagnostiquer l'overfitting : Comparer les performances des top-modèles (notamment les Stacked Ensembles vs modèles uniques comme XGBoost ou Random Forest) entre le jeu d'entraînement et le jeu de validation.
- Rédiger une note d'arbitrage : Argumenter le choix final du modèle retenu pour la production, en justifiant le compromis entre précision et temps d'inférence.
Critères d'évaluation :
- L'apprenant a correctement configuré l'AutoML en y intégrant au moins 3 paramètres restrictifs (temps, métrique de tri, validation croisée).
- Le choix final du modèle ne repose pas uniquement sur l'AUC brute, mais démontre une analyse de la LogLoss et de l'absence d'overfitting.
- La note d'arbitrage est claire, utilise le vocabulaire adéquat (compromis biais-variance, généralisation) et est compréhensible par un Lead Data Scientist.
Livrables :
- Un Notebook Python (.ipynb)
- Une note d'arbitrage (format Markdown dans le notebook
✓ Créer des modèles de Machine Learning automatisés
✓ Évaluer et comparer les performances des modèles
✓ Déployer des modèles avec H2O.ai
2 jours
Formation synchrone en téléprésentiel
Tarif inter-entreprises : 3300€ / participant
Tarif intra-entreprise : sur demande
Data scientists, analystes avancés.
Connaissances en ML de base et Python/R.
- Observation directe pendant la phase de production du formateur
- Évaluation par les pairs (Peer-Review)
- Correction des dépôts de code après la session par le formateur
Si vous êtes en situation de handicap, il est possible de mettre en place des aménagements