DATAROCKSTARS
Réf. IA-EXP-06Revenir au menu
Catalogue entreprises › Formations informatiques › Intelligence artificielle expert

Machine learning distribué avec Spark ML

Entraîner des modèles sur de grands volumes avec Spark ML

3 jours · 21 h Niveau expert Présentiel, distanciel synchrone, hybride Inter · Intra · Sur mesure

Descriptif

Machine learning distribué avec Spark ML est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle expert ». Entraîner des modèles sur de grands volumes avec Spark ML. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.

Objectifs pédagogiques

À l'issue de la formation, le participant sera capable de :

  • Maîtriser la conception et l'implémentation de pipelines ML distribués avec
  • Optimiser les performances des algorithmes ML sur des clusters Spark
  • Mettre en place des stratégies robustes d'évaluation, tuning et déploiement de modèles ML distribués
  • Appliquer des techniques avancées de préparation, transformation et feature engineering sur de larges jeux de données
  • Fondamentaux et architecture de Spark ML pour le Machine Learning distribué

Programme détaillé

N°Contenus et activités Durée
Jour 1
1Ouverture : recueil des contextes de cluster de chacun, accès à l'environnement Apache Spark 3.x, à Hive et au Delta Lake des travaux pratiques0,5 h
2Exécution distribuée d'un pipeline ML : partitions, shuffle, plan Catalyst et lecture de la Spark UI1,5 h
3Travaux pratiques : bâtir un Pipeline PySpark complet (Imputer, StringIndexer, OneHotEncoder, VectorAssembler) sur 50 Go fictifs de journaux de transactions3 h
4Laboratoire : diagnostiquer un job lent — déséquilibre de partitions, déversement sur disque, diffusion des petites tables, mise en cache2 h
Jour 2
5Travaux pratiques : feature engineering à l'échelle — fenêtres temporelles, agrégations, Bucketizer, hachage des variables à forte cardinalité, écriture en Delta Lake2,5 h
6Laboratoire : entraîner et comparer régression logistique distribuée, GBTClassifier et RandomForestClassifier avec CrossValidator, TrainValidationSplit et évaluateurs AUC-ROC et F12,5 h
7Atelier : Scala ou PySpark ? Mesurer le coût de sérialisation des UDF Python sur la même tâche et réécrire le point chaud en Scala sous IntelliJ IDEA2 h
Jour 3
8Travaux pratiques : journaliser les expériences avec MLflow — paramètres, métriques, artefacts, registre de modèles et promotion d'une version2 h
9Cas pratique : orchestrer avec Apache Airflow un réentraînement hebdomadaire qui lit Hive, entraîne sur Spark et publie le modèle2,5 h
10Laboratoire : arbitrage de coût et d'échelle — comparer l'entraînement Spark et un scikit-learn local sur échantillon, dimensionner exécuteurs, cœurs et mémoire1,5 h
11Synthèse : revue d'architecture des pipelines produits, évaluation des acquis et plan d'action1 h

Méthodes pédagogiques

  • Pédagogie active : 86 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
  • répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
  • classe inversée avec prérequis sur le LMS
  • apprentissage adaptatif selon le positionnement initial
  • travaux en binômes
  • classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
  • support clair, complet et paginé remis à chaque participant

Technologies et outils mobilisés

LMS DATAROCKSTARS, Apache Spark 3.x avec Spark MLlib, IDE : IntelliJ IDEA (Scala), Jupyter Notebook (Python), Langages : Scala, Python (PySpark), SGBD : Apache Hive, Delta Lake, Outils de gestion de workflow : MLflow, Apache Airflow, Bibliothèques complémentaires : pandas, scikit-learn (pour comparaison locale) aux certifications éditeurs

Modalités d'évaluation et de validation

  • Positionnement initial en ligne
  • quiz de validation à chaque séquence
  • évaluation finale des acquis (QCM et mise en situation)
  • satisfaction à chaud
  • questionnaire de transfert à 30 jours
  • attestation de fin de formation

Plateforme, laboratoires et ressources

  • LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
  • laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
  • bibliothèque O'Reilly (plus de 60 000 ressources)
  • accès aux supports pendant 6 mois

Fiche mise à jour le 21/09/2026 — version 1.0. Les programmes sont révisés chaque trimestre et à chaque évolution majeure des technologies, normes ou référentiels de certification concernés.