Descriptif
Apprentissage automatique avancé est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle expert ». Maîtriser les méthodes avancées d'apprentissage supervisé et non supervisé. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Ensembles
- Séries temporelles
- Non supervisé
- Déséquilibre
- Interprétabilité
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Cadrage : positionnement sur les méthodes d'ensemble, présentation du jeu fictif fil rouge (résiliation d'abonnés, 400 000 lignes) et du dépôt d'expériences | 0,5 h |
| 2 | Bagging, boosting et gradient boosting : ce que XGBoost, LightGBM et CatBoost traitent différemment | 1,5 h |
| 3 | Travaux pratiques : entraîner et régler XGBoost par recherche bayésienne avec Optuna, suivre AUC-ROC, AUC-PR et log-loss en validation croisée stratifiée | 3 h |
| 4 | Laboratoire : empilement de modèles et calibration des probabilités — courbe de fiabilité, Platt, isotonique, score de Brier | 2 h |
| Jour 2 | ||
| 5 | Travaux pratiques : validation croisée temporelle, fuites de données et variables décalées sur un jeu fictif de consommation énergétique | 2,5 h |
| 6 | Laboratoire : comparer une référence saisonnière, un gradient boosting sur fenêtres glissantes et un modèle récurrent — MAE, sMAPE, MASE et intervalles de prédiction | 2,5 h |
| 7 | Atelier : classes déséquilibrées à 1 pour 500 — rééchantillonnage, SMOTE, pondération et seuil de décision optimisé sur le coût métier | 2 h |
| Jour 3 | ||
| 8 | Travaux pratiques : segmentation sur données mixtes — k-means, DBSCAN, HDBSCAN et mélanges gaussiens, en tranchant avec la silhouette, l'indice de Davies-Bouldin et la stabilité par rééchantillonnage | 2,5 h |
| 9 | Laboratoire : détection d'anomalies par Isolation Forest et autoencodeur, mesure de la dérive par indice de stabilité de population et test de Kolmogorov-Smirnov | 1,5 h |
| 10 | Atelier : interprétabilité avec SHAP, importance par permutation et graphiques de dépendance partielle — repérer une corrélation trompeuse et la documenter | 2 h |
| 11 | Synthèse : soutenance courte des résultats par binôme, évaluation des acquis et plan d'action individuel | 1 h |
Méthodes pédagogiques
- Pédagogie active : 86 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
PyTorch, scikit-learn, XGBoost
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
