Descriptif
Déployer et passer à l'échelle les modèles : cloud, GPU et inférence est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle expert ». Déployer des modèles performants et économes sur une infrastructure maîtrisée. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Serving
- GPU
- Quantification
- Kubernetes
- Coûts
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Cadrage : attentes, contraintes d'infrastructure de chacun, accès au cluster Kubernetes et aux GPU du laboratoire | 0,5 h |
| 2 | Travaux pratiques : servir un modèle avec vLLM — traitement continu par lots, PagedAttention, parallélisme de tenseurs, et mesurer débit, latence du premier jeton et latence par jeton | 3 h |
| 3 | Laboratoire : Triton Inference Server — backends ONNX et TensorRT, regroupement dynamique des requêtes, plusieurs modèles sur un même GPU | 2 h |
| 4 | Atelier : lire une fiche technique GPU et dimensionner — mémoire nécessaire, longueur de contexte, cache clé-valeur, requêtes simultanées | 1,5 h |
| Jour 2 | ||
| 5 | Travaux pratiques : quantification INT8, FP8 et AWQ — mesurer la perte de qualité sur un jeu d'évaluation fictif face au gain en mémoire et en débit | 2,5 h |
| 6 | Laboratoire : déployer sur Kubernetes — manifestes, sélection des nœuds GPU, sondes de vivacité et de disponibilité, mise à l'échelle horizontale et retour à zéro réplique | 2,5 h |
| 7 | Atelier : injection de pannes — perte d'un nœud GPU, saturation de la file d'attente, démarrage à froid, et mesurer l'effet sur le service rendu | 2 h |
| Jour 3 | ||
| 8 | Travaux pratiques : observabilité — exposer les métriques vers Prometheus, tracer les requêtes avec Langfuse, définir objectifs de service et alertes | 2,5 h |
| 9 | Laboratoire : essai de charge comparatif — courbe débit / latence, point de saturation, choix du point de fonctionnement et du nombre de répliques | 2 h |
| 10 | Cas pratique : arbitrage économique entre GPU loué à l'heure, service géré et modèle de marché facturé au jeton — construire le modèle de coût sur trois profils de trafic | 1,5 h |
| 11 | Synthèse : revue d'architecture de déploiement, évaluation des acquis et plan d'action | 1 h |
Méthodes pédagogiques
- Pédagogie active : 93 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
Kubernetes, vLLM, Triton Inference Server, Langfuse, Prometheus
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
