Descriptif
Apache Spark avancé : traitement Big Data avec PySpark est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Bases de données, outils décisionnels, Big Data et Cloud Computing ». Développer et optimiser des traitements distribués avec Spark. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Optimiser les traitements Spark pour améliorer la performance et réduire les coûts de calcul
- Utiliser efficacement les RDD et DataFrame pour manipuler et transformer de grands volumes de données
- Gérer les ressources et la parallélisation dans un environnement Big Data distribué
- Déboguer et profiler des applications Spark pour identifier et corriger les goulets d'étranglement
- Mettre en œuvre des stratégies avancées de partitionnement et de gestion de la mémoire
- Exploiter les fonctionnalités Spark SQL et Spark Streaming pour des traitements temps réel et batch
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Positionnement, présentation du cluster Spark 3.x et des jeux de données de travaux pratiques | 0,5 h |
| 2 | Moteur d'exécution : DAG, étapes, tâches, mélange, évaluation paresseuse, RDD face aux DataFrame et à Catalyst | 2 h |
| 3 | Travaux pratiques : reprendre un traitement RDD en DataFrame PySpark sur 200 millions de lignes et comparer les temps | 2,5 h |
| 4 | Lecture du Spark UI : étapes, tâches traînantes, volumes de mélange, ramasse-miettes et débordement sur disque | 2 h |
| Jour 2 | ||
| 5 | Partitionnement, repartition et coalesce, bucketing, diffusion des petites tables et jointures asymétriques | 1,5 h |
| 6 | Travaux pratiques : corriger une jointure déséquilibrée par salage de clé et diffusion, diviser par quatre le temps d'exécution | 2,5 h |
| 7 | Mémoire et ressources : executors, cœurs, mémoire unifiée, cache et persist, allocation dynamique sur YARN | 1,5 h |
| 8 | Laboratoire : profiler un traitement en échec par dépassement mémoire, corriger la configuration et rejouer | 1,5 h |
| Jour 3 | ||
| 9 | Spark SQL avancé : fonctions de fenêtrage, UDF et Pandas UDF, lecture Hive et Cassandra, écriture Parquet partitionnée | 1,5 h |
| 10 | Travaux pratiques : construire un traitement Structured Streaming lisant Kafka, filigrane, fenêtres et écriture idempotente | 2 h |
| 11 | Atelier : ordonnancer la chaîne avec Apache Airflow et instrumenter Grafana sur les métriques Spark | 1,5 h |
| 12 | Révision guidée des domaines de la certification Databricks Certified Associate Developer for Apache Spark | 1 h |
| 13 | Examen blanc chronométré et correction commentée question par question | 1 h |
Méthodes pédagogiques
- Pédagogie active : 48 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
LMS DATAROCKSTARS, Apache Spark 3.x, Apache Hadoop HDFS, Apache Kafka, IntelliJ IDEA avec plugin Scala, Jupyter Notebook avec PySpark, Spark UI et outils de monitoring (Ganglia, Grafana), Apache Airflow, SGBD Hive et Cassandra
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
- préparation et passage de la certification Databricks Certified Associate Developer for Apache Spark, examen en sus
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
