DATAROCKSTARS
Réf. INF-BDD-37Revenir au menu
Catalogue entreprises › Formations informatiques › Bases de données, outils décisionnels, Big Data et Cloud Computing

Apache Spark avancé : traitement Big Data avec PySpark

Développer et optimiser des traitements distribués avec Spark

3 jours · 21 h Niveau expert Présentiel, distanciel synchrone, hybride Inter · Intra · Sur mesure Certifiante · Databricks Certified Associate Developer for Apache Spark, examen en sus

Descriptif

Apache Spark avancé : traitement Big Data avec PySpark est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Bases de données, outils décisionnels, Big Data et Cloud Computing ». Développer et optimiser des traitements distribués avec Spark. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.

Objectifs pédagogiques

À l'issue de la formation, le participant sera capable de :

  • Optimiser les traitements Spark pour améliorer la performance et réduire les coûts de calcul
  • Utiliser efficacement les RDD et DataFrame pour manipuler et transformer de grands volumes de données
  • Gérer les ressources et la parallélisation dans un environnement Big Data distribué
  • Déboguer et profiler des applications Spark pour identifier et corriger les goulets d'étranglement
  • Mettre en œuvre des stratégies avancées de partitionnement et de gestion de la mémoire
  • Exploiter les fonctionnalités Spark SQL et Spark Streaming pour des traitements temps réel et batch

Programme détaillé

N°Contenus et activités Durée
Jour 1
1Positionnement, présentation du cluster Spark 3.x et des jeux de données de travaux pratiques0,5 h
2Moteur d'exécution : DAG, étapes, tâches, mélange, évaluation paresseuse, RDD face aux DataFrame et à Catalyst2 h
3Travaux pratiques : reprendre un traitement RDD en DataFrame PySpark sur 200 millions de lignes et comparer les temps2,5 h
4Lecture du Spark UI : étapes, tâches traînantes, volumes de mélange, ramasse-miettes et débordement sur disque2 h
Jour 2
5Partitionnement, repartition et coalesce, bucketing, diffusion des petites tables et jointures asymétriques1,5 h
6Travaux pratiques : corriger une jointure déséquilibrée par salage de clé et diffusion, diviser par quatre le temps d'exécution2,5 h
7Mémoire et ressources : executors, cœurs, mémoire unifiée, cache et persist, allocation dynamique sur YARN1,5 h
8Laboratoire : profiler un traitement en échec par dépassement mémoire, corriger la configuration et rejouer1,5 h
Jour 3
9Spark SQL avancé : fonctions de fenêtrage, UDF et Pandas UDF, lecture Hive et Cassandra, écriture Parquet partitionnée1,5 h
10Travaux pratiques : construire un traitement Structured Streaming lisant Kafka, filigrane, fenêtres et écriture idempotente2 h
11Atelier : ordonnancer la chaîne avec Apache Airflow et instrumenter Grafana sur les métriques Spark1,5 h
12Révision guidée des domaines de la certification Databricks Certified Associate Developer for Apache Spark1 h
13Examen blanc chronométré et correction commentée question par question1 h

Méthodes pédagogiques

  • Pédagogie active : 48 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
  • répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
  • classe inversée avec prérequis sur le LMS
  • apprentissage adaptatif selon le positionnement initial
  • travaux en binômes
  • classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
  • support clair, complet et paginé remis à chaque participant

Technologies et outils mobilisés

LMS DATAROCKSTARS, Apache Spark 3.x, Apache Hadoop HDFS, Apache Kafka, IntelliJ IDEA avec plugin Scala, Jupyter Notebook avec PySpark, Spark UI et outils de monitoring (Ganglia, Grafana), Apache Airflow, SGBD Hive et Cassandra

Modalités d'évaluation et de validation

  • Positionnement initial en ligne
  • quiz de validation à chaque séquence
  • évaluation finale des acquis (QCM et mise en situation)
  • satisfaction à chaud
  • questionnaire de transfert à 30 jours
  • attestation de fin de formation
  • préparation et passage de la certification Databricks Certified Associate Developer for Apache Spark, examen en sus

Plateforme, laboratoires et ressources

  • LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
  • laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
  • bibliothèque O'Reilly (plus de 60 000 ressources)
  • accès aux supports pendant 6 mois

Fiche mise à jour le 21/09/2026 — version 1.0. Les programmes sont révisés chaque trimestre et à chaque évolution majeure des technologies, normes ou référentiels de certification concernés.