Descriptif
IA générative multimodale : diffusion et modèles vision-langage est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle expert ». Comprendre et mettre en œuvre les modèles génératifs multimodaux. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Modèles de diffusion
- Vision-langage
- Audio
- Adaptation
- Évaluation
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Ouverture : recueil des cas d'usage multimodaux visés, mise en route de l'environnement GPU et des modèles ouverts du laboratoire | 0,5 h |
| 2 | Démonstration commentée : du débruitage progressif aux modèles de diffusion latente — équations, planificateurs de bruit et guidage sans classifieur | 2 h |
| 3 | Travaux pratiques : implémenter la boucle d'échantillonnage DDPM puis DDIM en PyTorch sur un jeu fictif de motifs textiles, comparer nombre de pas et qualité | 3 h |
| 4 | Laboratoire : mesurer la qualité générative — FID, score CLIP et diversité, puis éprouver les limites et les biais de ces métriques | 1,5 h |
| Jour 2 | ||
| 5 | Travaux pratiques : adapter un modèle de diffusion par LoRA et DreamBooth sur dix images d'un produit fictif, contrôler le surapprentissage | 2,5 h |
| 6 | Laboratoire : guidage conditionnel — ControlNet, masques de retouche et consignes négatives sur un cahier des charges imposé | 2 h |
| 7 | Atelier : modèles vision-langage — interroger Pixtral sur un corpus fictif de plans et de factures, construire un protocole d'extraction structurée et mesurer son exactitude | 2,5 h |
| Jour 3 | ||
| 8 | Travaux pratiques : chaîne audio — transcription et horodatage avec Whisper, diarisation confiée à un modèle dédié de type pyannote.audio que Whisper n'assure pas, et mesure du taux d'erreur mot sur un corpus bruité fictif | 2,5 h |
| 9 | Cas pratique : assembler un pipeline multimodal document vers texte vers réponse, arbitrer entre modèle ouvert hébergé et service de marché (Le Chat de Mistral AI, ChatGPT Enterprise, Microsoft 365 Copilot) sur coût, latence et confidentialité | 2,5 h |
| 10 | Laboratoire : traçabilité des contenus générés — filigranage, métadonnées de provenance et journalisation des consignes | 1 h |
| 11 | Synthèse : revue des livrables, évaluation des acquis et plan d'action individuel | 1 h |
Méthodes pédagogiques
- Pédagogie active : 83 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
Modèles de diffusion, PyTorch, ControlNet, DreamBooth, Modèles vision-langage, Pixtral, Whisper, pyannote.audio
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
