Descriptif
AutoML avec H2O.ai est une formation de 2 jours (14 heures), de niveau intermédiaire, rattachée au domaine « Intelligence artificielle expert ». Automatiser la construction de modèles avec H2O. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Configurer et lancer des expériences AutoML avec H2O.ai pour différents types de données
- Analyser et interpréter les résultats et métriques des modèles générés automatiquement
- Optimiser les pipelines de modélisation en ajustant les paramètres AutoML et en intégrant des données spécifiques
- Mettre en production et monitorer des modèles créés avec H2O.ai dans un environnement réel
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Cadrage : attentes, périmètre réel de l'AutoML, démarrage du cluster H2O local et connexion depuis Jupyter Notebook et RStudio | 1 h |
| 2 | Démonstration commentée : anatomie de H2OAutoML — familles de modèles explorées, budget de temps, validation croisée et tableau de classement | 1,5 h |
| 3 | Travaux pratiques : importer un jeu fictif de scoring de crédit depuis PostgreSQL, typer les colonnes, lancer une première expérience AutoML et lire le leaderboard | 2,5 h |
| 4 | Laboratoire : interpréter les modèles générés — importance des variables, valeurs de Shapley, graphiques de dépendance partielle et courbes d'apprentissage | 2 h |
| Jour 2 | ||
| 5 | Travaux pratiques : piloter l'exploration — max_models, exclude_algos, métrique de tri (AUC, logloss, RMSE), blocage des fuites et validation temporelle | 2 h |
| 6 | Atelier : enrichir le jeu de variables métier avec pandas et mesurer le gain réel face au modèle AutoML brut, puis comparer à une référence scikit-learn | 2 h |
| 7 | Cas pratique : exporter le modèle au format MOJO, l'emballer dans une image Docker et exposer une inférence par lots reproductible | 2 h |
| 8 | Synthèse : grille de décision AutoML ou modélisation sur mesure, indicateurs de surveillance en production et plan d'action individuel | 1 h |
Méthodes pédagogiques
- Pédagogie active : 75 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
LMS DATAROCKSTARS, H2O.ai AutoML (bibliothèque Python et R), Jupyter Notebook / RStudio, Python (pandas, scikit-learn, matplotlib), Bases de données SQL (PostgreSQL ou équivalent), Docker (pour déploiement et environnement reproductible)
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
