Descriptif
Apache Kafka : streaming de données est une formation de 3 jours (21 heures), de niveau intermédiaire, rattachée au domaine « Bases de données, outils décisionnels, Big Data et Cloud Computing ». Concevoir et exploiter des flux de données temps réel avec Kafka. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Déployer et configurer un cluster Apache Kafka adapté aux besoins métiers
- Produire et consommer des messages en temps réel avec gestion des erreurs
- Gérer efficacement les topics, partitions et réplicas pour optimiser la scalabilité
- Assurer la fiabilité, la résilience et la sécurité des flux de données
- Optimiser la performance et le monitoring des clusters Kafka
- Mettre en place des architectures de streaming pour le traitement en temps réel
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Cadrage, cas de flux temps réel des participants et démarrage de la plateforme Docker Compose | 0,5 h |
| 2 | Anatomie de Kafka : brokers, topics, partitions, offsets, réplicas, réplicas synchrones et rôle du contrôleur | 2 h |
| 3 | Travaux pratiques : monter un cluster à trois brokers, créer des topics et manipuler les outils console de production et de consommation | 2 h |
| 4 | Producteurs : clé de partitionnement, acks, idempotence, lots, compression, gestion des erreurs et reprises | 1,5 h |
| 5 | Travaux pratiques : écrire un producteur Java et un producteur Python injectant 1 million de messages, mesurer le débit | 1 h |
| Jour 2 | ||
| 6 | Consommateurs : groupes, rééquilibrage, validation des offsets, sémantiques au plus une fois, au moins une fois et exactement une fois | 1,5 h |
| 7 | Travaux pratiques : traiter les erreurs par rejeu et file de messages morts, tester la reprise après arrêt brutal d'un consommateur | 2 h |
| 8 | Kafka Connect et Schema Registry : connecteurs source et puits, Avro, règles de compatibilité de schéma | 1,5 h |
| 9 | Travaux pratiques : déverser un flux PostgreSQL vers Kafka puis vers HDFS avec contrôle de compatibilité de schéma | 2 h |
| Jour 3 | ||
| 10 | Dimensionnement et performance : nombre de partitions, rétention, compaction, réglages disque et réseau, cas de saturation | 1,5 h |
| 11 | Laboratoire : superviser le cluster avec Prometheus et Grafana, provoquer un retard de consommation et le résorber | 2 h |
| 12 | Travaux pratiques : activer TLS et SASL, poser listes de contrôle d'accès et quotas, migrer une partition sans coupure | 1,5 h |
| 13 | Révision guidée des domaines de la certification Confluent Certified Developer for Apache Kafka | 1 h |
| 14 | Examen blanc chronométré et correction commentée | 1 h |
Méthodes pédagogiques
- Pédagogie active : 50 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
LMS DATAROCKSTARS, Apache Kafka (dernier stable), Confluent Platform (Kafka Connect, Schema Registry), IDE IntelliJ IDEA ou VS Code, Docker et Docker Compose pour déploiement local, Bibliothèques Kafka clients Java et Python, Outils de monitoring : Prometheus, Grafana, Kafka Manager, Zoom/ Teams pour les classes virtuelles, Slack pour l'entraide asynchrone.
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
- préparation et passage de la certification Confluent Certified Developer for Apache Kafka, examen en sus
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
