Intelligence Artificielle - Débutant

AutoML avec H2O.ai

Cette formation intensive permet aux data scientists de maîtriser l’automatisation de la création, de l’évaluation et du déploiement de modèles de Machine Learning avec H2O.ai.

Programme de la formation

La formation se déroule sur 2 jours et s’articule autour de plusieurs mises en situation pratiques.

Jour 1

  • Introduction à la formation et mise en place de la veille technologique
  • Brief 1 : Initialisation guidée d’un pipeline AutoML avec H2O
  • Brief 2 : Optimisation fine et arbitrage des modèles via le Leaderboard
  • H2OFrame, Cluster, Leaderboard, Overfitting

Jour 2

  • Travail de veille : les bonnes pratiques MLOps pour le monitoring et la maintenance à long terme des modèles H2O en production
  • Brief 3 : Industrialisation et déploiement d’un modèle H2O en production
  • MLOps, CI/CD, versionning, déploiement en production
  • Analyse réflexive et formalisation des apprentissages

Exemple de mise en situation 

Optimisation fine et arbitrage des modèles via le Leaderboard H2O 

Contexte : 

L'entreprise de prêt-à-porter en ligne "Mod'Express" fait face à une augmentation anormale du taux de désabonnement (churn) de ses clients Premium. Un premier modèle prédictif a été lancé à la va-vite en utilisant les paramètres par défaut de H2O AutoML.

Le problème ? Le modèle désigné "Leader" par l'outil affiche un score d'AUC parfait sur les données d'entraînement, mais s'effondre complètement lors des tests en conditions réelles. De plus, son temps de calcul actuel est beaucoup trop long pour les capacités du serveur de l'entreprise. 

En tant que Data Scientist Senior, vous reprenez la main sur l'algorithme, en reconfigurant finement le processus d'AutoML pour éviter le surapprentissage (overfitting), et de rédiger une note d'arbitrage pour la direction technique afin de choisir le modèle le plus robuste et industrialisable. 

Votre mission est de : 

- Reconfigurer et brider l'AutoML : Mettre en place des contraintes strictes dans le script Python (max_runtime_secs, max_models, exclusion des algorithmes trop lourds comme les Deep Learning complexes si nécessaire). 

- Piloter la validation croisée (Cross-Validation) : Configurer les paramètres de N-fold cross-validation pour obtenir des métriques de performance réalistes et non biaisées. 

- Explorer et décortiquer le Leaderboard : Extraire le tableau des scores H2O et analyser les métriques clés (AUC, LogLoss, RMSE, mean_per_class_error) au-delà du simple classement par défaut. 

- Diagnostiquer l'overfitting : Comparer les performances des top-modèles (notamment les Stacked Ensembles vs modèles uniques comme XGBoost ou Random Forest) entre le jeu d'entraînement et le jeu de validation. 

- Rédiger une note d'arbitrage : Argumenter le choix final du modèle retenu pour la production, en justifiant le compromis entre précision et temps d'inférence. 

Critères d'évaluation : 

- L'apprenant a correctement configuré l'AutoML en y intégrant au moins 3 paramètres restrictifs (temps, métrique de tri, validation croisée). 

- Le choix final du modèle ne repose pas uniquement sur l'AUC brute, mais démontre une analyse de la LogLoss et de l'absence d'overfitting. 

- La note d'arbitrage est claire, utilise le vocabulaire adéquat (compromis biais-variance, généralisation) et est compréhensible par un Lead Data Scientist. 

Livrables : 

- Un Notebook Python (.ipynb) 

- Une note d'arbitrage (format Markdown dans le notebook

Compétences visées

Créer des modèles de Machine Learning automatisés

Évaluer et comparer les performances des modèles

Déployer des modèles avec H2O.ai

Durée & Format

2 jours

Formation synchrone en téléprésentiel

Tarif de la formation

Tarif inter-entreprises : 3300€ / participant

Tarif intra-entreprise : sur demande

Public

Data scientists, analystes avancés.

Prérequis

Connaissances en ML de base et Python/R.

Pédagogie et techniques

  • Temps 1 : Briefing & Apports théoriques (Collectif) 
  • Temps 2 : Phase de production (Individuel / Autonomie) 
  • Temps 3 : Restitution & Revue par les pairs (Binômes puis Collectif) 

Modalités d’évaluation

- Observation directe pendant la phase de production du formateur 

- Évaluation par les pairs (Peer-Review) 

- Correction des dépôts de code après la session par le formateur 

Handicap

Si vous êtes en situation de handicap, il est possible de mettre en place des aménagements

Cette formation vous intéresse ? 
Contactez-nous pour échanger sur votre projet de formation.