Descriptif
Machine learning distribué avec Spark ML est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle expert ». Entraîner des modèles sur de grands volumes avec Spark ML. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Maîtriser la conception et l'implémentation de pipelines ML distribués avec
- Optimiser les performances des algorithmes ML sur des clusters Spark
- Mettre en place des stratégies robustes d'évaluation, tuning et déploiement de modèles ML distribués
- Appliquer des techniques avancées de préparation, transformation et feature engineering sur de larges jeux de données
- Fondamentaux et architecture de Spark ML pour le Machine Learning distribué
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Ouverture : recueil des contextes de cluster de chacun, accès à l'environnement Apache Spark 3.x, à Hive et au Delta Lake des travaux pratiques | 0,5 h |
| 2 | Exécution distribuée d'un pipeline ML : partitions, shuffle, plan Catalyst et lecture de la Spark UI | 1,5 h |
| 3 | Travaux pratiques : bâtir un Pipeline PySpark complet (Imputer, StringIndexer, OneHotEncoder, VectorAssembler) sur 50 Go fictifs de journaux de transactions | 3 h |
| 4 | Laboratoire : diagnostiquer un job lent — déséquilibre de partitions, déversement sur disque, diffusion des petites tables, mise en cache | 2 h |
| Jour 2 | ||
| 5 | Travaux pratiques : feature engineering à l'échelle — fenêtres temporelles, agrégations, Bucketizer, hachage des variables à forte cardinalité, écriture en Delta Lake | 2,5 h |
| 6 | Laboratoire : entraîner et comparer régression logistique distribuée, GBTClassifier et RandomForestClassifier avec CrossValidator, TrainValidationSplit et évaluateurs AUC-ROC et F1 | 2,5 h |
| 7 | Atelier : Scala ou PySpark ? Mesurer le coût de sérialisation des UDF Python sur la même tâche et réécrire le point chaud en Scala sous IntelliJ IDEA | 2 h |
| Jour 3 | ||
| 8 | Travaux pratiques : journaliser les expériences avec MLflow — paramètres, métriques, artefacts, registre de modèles et promotion d'une version | 2 h |
| 9 | Cas pratique : orchestrer avec Apache Airflow un réentraînement hebdomadaire qui lit Hive, entraîne sur Spark et publie le modèle | 2,5 h |
| 10 | Laboratoire : arbitrage de coût et d'échelle — comparer l'entraînement Spark et un scikit-learn local sur échantillon, dimensionner exécuteurs, cœurs et mémoire | 1,5 h |
| 11 | Synthèse : revue d'architecture des pipelines produits, évaluation des acquis et plan d'action | 1 h |
Méthodes pédagogiques
- Pédagogie active : 86 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
LMS DATAROCKSTARS, Apache Spark 3.x avec Spark MLlib, IDE : IntelliJ IDEA (Scala), Jupyter Notebook (Python), Langages : Scala, Python (PySpark), SGBD : Apache Hive, Delta Lake, Outils de gestion de workflow : MLflow, Apache Airflow, Bibliothèques complémentaires : pandas, scikit-learn (pour comparaison locale) aux certifications éditeurs
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
