Intelligence Artificielle - Intermédiaire

Introduction au Machine Learning avec Scikit-learn

Maîtrisez la création et l'évaluation de modèles Machine Learning en deux jours intensifs avec Scikit-learn. Cette formation intermédiaire vous propulse du code Python à des pipelines ML prêts pour la production, à travers une mise en situation concrète : segmenter une base clients et structurer votre travail comme en vrai projet d'équipe. Idéale pour les débutants en ML et data scientists juniors qui veulent passer du théorique à l'opérationnel.

Programme de la formation

Segmenter une base client et structurer le pipeline ML 

Contexte : 

Vous venez de rejoindre l'équipe Data d'une entreprise de e-commerce en tant que Data Scientist junior. Le département marketing souhaite lancer des campagnes publicitaires ciblées, mais il ne dispose d'aucune classification de sa base de données clients. Votre mission est de créer une segmentation automatique des clients selon leurs comportements d'achat et de livrer un code propre, standardisé et prêt à être réutilisé par l'équipe d'ingénierie logicielle. 

Votre mission est de :

- Charger le jeu de données d'activité des clients et normaliser les fonctionnalités numériques pertinentes (fréquence d'achat, panier moyen). 

- Mettre en œuvre l'algorithme K-Means pour diviser la base clients en plusieurs segments. - Déterminer mathématiquement le nombre optimal de clusters en utilisant la méthode du coude (Elbow Method) et le score de Silhouette. 

- Sécuriser et automatiser l'enchaînement des étapes (Data Scaling + Modèle K-Means) en utilisant l'objet Pipeline de Scikit-learn. 

- Exporter le pipeline final entraîné dans un fichier sérialisé pour permettre son utilisation future en production. 

Compétences

À l’issue de la formation, le stagiaire sera capable de créer et évaluer des modèles ML.

Durée

2 jours 

Tarifs

Prix inter-entreprises : 1 440,00 €

Pix intra-entreprise : sur demande

Publics

Débutants en Machine Learning et data scientists juniors.

Pré-requis 

Connaissances en Python et statistiques de base.

Objectifs Pédagogiques

- Construire des modèles supervisés et non supervisés 

- Évaluer et comparer les modèles 

- Préparer les données pour le ML

Modalités pédagogiques

Vous avez 0,75 jour pour réaliser ce travail de segmentation et de structuration. Vous réaliserez ce travail en individuel. L'entraide est bienvenue. 

Modalités d'évaluation

- Votre responsable technique validera en individuel l'architecture de votre pipeline Scikit-learn et la génération du fichier exporté. 

- Votre responsable technique (formateur) animera une revue de code collective au cours de laquelle vous devrez justifier graphiquement le choix de votre nombre de clusters. 

Critères d'évaluation : 

- Le code s'exécute sans erreur et utilise obligatoirement la classe Pipeline de Scikit-learn pour lier le prétraitement et le modèle. 

- Le nombre de clusters retenu est rigoureusement argumenté à l'aide des métriques d'évaluation (Silhouette, Inertie). 

- L'artefact final du modèle est correctement sauvegardé et fonctionnel lors d'un test de rechargement.

Livrables : 

- Le notebook Python (.ipynb) documenté contenant l'analyse, les graphiques d'évaluation et la construction du pipeline. 

- Le fichier du modèle sérialisé (.joblib ou .pkl).

Handicap

Si vous êtes en situation de handicap, il est possible de mettre en place des aménagements

Session

Prochaine session le 19 Novembre 2026

Cette formation vous intéresse ? 
Contactez-nous pour échanger sur votre projet de formation.