Descriptif
IBM DataStage : développer des traitements ETL est une formation de 3 jours (21 heures), de niveau intermédiaire, rattachée au domaine « Bases de données, outils décisionnels, Big Data et Cloud Computing ». Concevoir, développer et optimiser des jobs ETL DataStage. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Architecture DataStage
- Conception de jobs
- Transformations et jointures
- Parallélisme et performance
- Exploitation et reprise
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Tour de table, recueil des contextes d'intégration et connexion aux projets DataStage du laboratoire | 0,5 h |
| 2 | Architecture IBM DataStage : moteur parallèle, projets et référentiel, rôles respectifs du Designer, du Director et de l'Administrator | 1,5 h |
| 3 | Travaux pratiques : créer un projet, définir les paramètres, importer les définitions de 14 tables sources dans le référentiel | 2 h |
| 4 | Travaux pratiques : premier job d'extraction avec les étapes Sequential File, Dataset et Peek, exécution et lecture des journaux | 3 h |
| Jour 2 | ||
| 5 | Travaux pratiques : étape Transformer — dérivations, contraintes, variables d'étape, gestion des lignes rejetées | 2,5 h |
| 6 | Travaux pratiques : Lookup, Join et Merge sur un référentiel clients de 4 millions de lignes, choisir l'étape selon la volumétrie | 2,5 h |
| 7 | Atelier : agrégation, tri, suppression des doublons et alimentation d'une table de faits en base cible | 2 h |
| Jour 3 | ||
| 8 | Le parallélisme DataStage : partitionnement et repartitionnement, fichier de configuration APT, points de collecte et de tri | 1 h |
| 9 | Travaux pratiques : optimiser un job lent — choix du partitionnement, suppression des tris implicites, mesure des débits avant et après | 2,5 h |
| 10 | Travaux pratiques : séquenceur de jobs, paramètres d'environnement, reprise sur incident et point de redémarrage | 2,5 h |
| 11 | Synthèse : règles de conception et de nommage, revue croisée des jobs produits et plan d'action | 1 h |
Méthodes pédagogiques
- Pédagogie active : 81 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
IBM DataStage
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
