DATAROCKSTARS
Réf. IA-EXP-10Revenir au menu
Catalogue entreprises › Formations informatiques › Intelligence artificielle expert

IA générative multimodale : diffusion et modèles vision-langage

Comprendre et mettre en œuvre les modèles génératifs multimodaux

3 jours · 21 h Niveau expert Présentiel, distanciel synchrone, hybride Inter · Intra · Sur mesure

Descriptif

IA générative multimodale : diffusion et modèles vision-langage est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle expert ». Comprendre et mettre en œuvre les modèles génératifs multimodaux. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.

Objectifs pédagogiques

À l'issue de la formation, le participant sera capable de :

  • Modèles de diffusion
  • Vision-langage
  • Audio
  • Adaptation
  • Évaluation

Programme détaillé

N°Contenus et activités Durée
Jour 1
1Ouverture : recueil des cas d'usage multimodaux visés, mise en route de l'environnement GPU et des modèles ouverts du laboratoire0,5 h
2Démonstration commentée : du débruitage progressif aux modèles de diffusion latente — équations, planificateurs de bruit et guidage sans classifieur2 h
3Travaux pratiques : implémenter la boucle d'échantillonnage DDPM puis DDIM en PyTorch sur un jeu fictif de motifs textiles, comparer nombre de pas et qualité3 h
4Laboratoire : mesurer la qualité générative — FID, score CLIP et diversité, puis éprouver les limites et les biais de ces métriques1,5 h
Jour 2
5Travaux pratiques : adapter un modèle de diffusion par LoRA et DreamBooth sur dix images d'un produit fictif, contrôler le surapprentissage2,5 h
6Laboratoire : guidage conditionnel — ControlNet, masques de retouche et consignes négatives sur un cahier des charges imposé2 h
7Atelier : modèles vision-langage — interroger Pixtral sur un corpus fictif de plans et de factures, construire un protocole d'extraction structurée et mesurer son exactitude2,5 h
Jour 3
8Travaux pratiques : chaîne audio — transcription et horodatage avec Whisper, diarisation confiée à un modèle dédié de type pyannote.audio que Whisper n'assure pas, et mesure du taux d'erreur mot sur un corpus bruité fictif2,5 h
9Cas pratique : assembler un pipeline multimodal document vers texte vers réponse, arbitrer entre modèle ouvert hébergé et service de marché (Le Chat de Mistral AI, ChatGPT Enterprise, Microsoft 365 Copilot) sur coût, latence et confidentialité2,5 h
10Laboratoire : traçabilité des contenus générés — filigranage, métadonnées de provenance et journalisation des consignes1 h
11Synthèse : revue des livrables, évaluation des acquis et plan d'action individuel1 h

Méthodes pédagogiques

  • Pédagogie active : 83 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
  • répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
  • classe inversée avec prérequis sur le LMS
  • apprentissage adaptatif selon le positionnement initial
  • travaux en binômes
  • classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
  • support clair, complet et paginé remis à chaque participant

Technologies et outils mobilisés

Modèles de diffusion, PyTorch, ControlNet, DreamBooth, Modèles vision-langage, Pixtral, Whisper, pyannote.audio

Modalités d'évaluation et de validation

  • Positionnement initial en ligne
  • quiz de validation à chaque séquence
  • évaluation finale des acquis (QCM et mise en situation)
  • satisfaction à chaud
  • questionnaire de transfert à 30 jours
  • attestation de fin de formation

Plateforme, laboratoires et ressources

  • LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
  • laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
  • bibliothèque O'Reilly (plus de 60 000 ressources)
  • accès aux supports pendant 6 mois

Fiche mise à jour le 21/09/2026 — version 1.0. Les programmes sont révisés chaque trimestre et à chaque évolution majeure des technologies, normes ou référentiels de certification concernés.