DATAROCKSTARS
Réf. IA-EXP-13Revenir au menu
Catalogue entreprises › Formations informatiques › Intelligence artificielle expert

Déployer et passer à l'échelle les modèles : cloud, GPU et inférence

Déployer des modèles performants et économes sur une infrastructure maîtrisée

3 jours · 21 h Niveau expert Présentiel, distanciel synchrone, hybride Inter · Intra · Sur mesure

Descriptif

Déployer et passer à l'échelle les modèles : cloud, GPU et inférence est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle expert ». Déployer des modèles performants et économes sur une infrastructure maîtrisée. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.

Objectifs pédagogiques

À l'issue de la formation, le participant sera capable de :

  • Serving
  • GPU
  • Quantification
  • Kubernetes
  • Coûts

Programme détaillé

N°Contenus et activités Durée
Jour 1
1Cadrage : attentes, contraintes d'infrastructure de chacun, accès au cluster Kubernetes et aux GPU du laboratoire0,5 h
2Travaux pratiques : servir un modèle avec vLLM — traitement continu par lots, PagedAttention, parallélisme de tenseurs, et mesurer débit, latence du premier jeton et latence par jeton3 h
3Laboratoire : Triton Inference Server — backends ONNX et TensorRT, regroupement dynamique des requêtes, plusieurs modèles sur un même GPU2 h
4Atelier : lire une fiche technique GPU et dimensionner — mémoire nécessaire, longueur de contexte, cache clé-valeur, requêtes simultanées1,5 h
Jour 2
5Travaux pratiques : quantification INT8, FP8 et AWQ — mesurer la perte de qualité sur un jeu d'évaluation fictif face au gain en mémoire et en débit2,5 h
6Laboratoire : déployer sur Kubernetes — manifestes, sélection des nœuds GPU, sondes de vivacité et de disponibilité, mise à l'échelle horizontale et retour à zéro réplique2,5 h
7Atelier : injection de pannes — perte d'un nœud GPU, saturation de la file d'attente, démarrage à froid, et mesurer l'effet sur le service rendu2 h
Jour 3
8Travaux pratiques : observabilité — exposer les métriques vers Prometheus, tracer les requêtes avec Langfuse, définir objectifs de service et alertes2,5 h
9Laboratoire : essai de charge comparatif — courbe débit / latence, point de saturation, choix du point de fonctionnement et du nombre de répliques2 h
10Cas pratique : arbitrage économique entre GPU loué à l'heure, service géré et modèle de marché facturé au jeton — construire le modèle de coût sur trois profils de trafic1,5 h
11Synthèse : revue d'architecture de déploiement, évaluation des acquis et plan d'action1 h

Méthodes pédagogiques

  • Pédagogie active : 93 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
  • répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
  • classe inversée avec prérequis sur le LMS
  • apprentissage adaptatif selon le positionnement initial
  • travaux en binômes
  • classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
  • support clair, complet et paginé remis à chaque participant

Technologies et outils mobilisés

Kubernetes, vLLM, Triton Inference Server, Langfuse, Prometheus

Modalités d'évaluation et de validation

  • Positionnement initial en ligne
  • quiz de validation à chaque séquence
  • évaluation finale des acquis (QCM et mise en situation)
  • satisfaction à chaud
  • questionnaire de transfert à 30 jours
  • attestation de fin de formation

Plateforme, laboratoires et ressources

  • LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
  • laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
  • bibliothèque O'Reilly (plus de 60 000 ressources)
  • accès aux supports pendant 6 mois

Fiche mise à jour le 21/09/2026 — version 1.0. Les programmes sont révisés chaque trimestre et à chaque évolution majeure des technologies, normes ou référentiels de certification concernés.