Descriptif
Databricks : la plateforme Lakehouse pour la data et l'IA est une formation de 3 jours (21 heures), de niveau intermédiaire, rattachée au domaine « Bases de données, outils décisionnels, Big Data et Cloud Computing ». Construire des pipelines de données et analyses sur la plateforme Databricks. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Architecture Lakehouse
- Delta Lake
- Traitements Spark et SQL
- Workflows et Unity Catalog
- Préparation à la certification
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Tour de table, objectifs de certification de chacun et ouverture des espaces de travail Databricks du laboratoire | 0,5 h |
| 2 | L'architecture Lakehouse : séparation stockage-calcul, comparaison data lake, entrepôt classique, Delta Lake et Iceberg | 1,5 h |
| 3 | Travaux pratiques : créer un cluster, explorer les notebooks, monter le stockage objet et charger 20 Go de fichiers CSV et JSON bruts | 2,5 h |
| 4 | Travaux pratiques : écrire les tables Delta de la couche bronze, observer le journal des transactions, le versionnement et le voyage dans le temps | 2,5 h |
| Jour 2 | ||
| 5 | Travaux pratiques : transformations Spark en PySpark et en SQL — nettoyage, jointures, fonctions de fenêtrage, construction de la couche silver | 3 h |
| 6 | Travaux pratiques : MERGE INTO, évolution de schéma, OPTIMIZE, Z-ORDER et VACUUM sur les tables de commandes | 2 h |
| 7 | Atelier : ingestion incrémentale avec Auto Loader et Structured Streaming sur un flux de fichiers déposés en continu | 2 h |
| Jour 3 | ||
| 8 | Travaux pratiques : orchestrer un workflow multi-tâches bronze-silver-gold, gérer reprises, dépendances, paramètres et alertes | 2,5 h |
| 9 | Atelier : gouverner avec Unity Catalog — catalogues, schémas, droits, lignage et partage des tables gold | 2 h |
| 10 | Révision guidée des domaines de l'examen Databricks Certified Data Engineer Associate | 1,5 h |
| 11 | Examen blanc chronométré, correction commentée et plan de préparation au passage de la certification | 1 h |
Méthodes pédagogiques
- Pédagogie active : 79 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
Databricks, Delta Lake, Apache Spark, Unity Catalog, Apache Iceberg
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
- préparation et passage de la certification Databricks Certified Data Engineer Associate, examen en sus
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
