Descriptif
IA multimodale : texte, image, audio et documents est une formation de 2 jours (14 heures), de niveau expert, rattachée au domaine « Intelligence artificielle pour l'IT ». Exploiter les modèles multimodaux pour traiter documents, images et audio. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Modèles vision-langage
- Analyse de documents
- Audio et transcription
- Génération d'images
- Cas d'usage
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Ouverture : cas d'usage documents, images et audio apportés par les participants, accès aux modèles | 0,5 h |
| 2 | Modèles vision-langage : encodage des images, résolution, limites, hallucinations visuelles, coût par page | 1,5 h |
| 3 | Travaux pratiques : extraire des données structurées de factures et de formulaires fictifs avec un modèle vision-langage | 3 h |
| 4 | Travaux pratiques : comparer Pixtral et un modèle ouvert de vision sur le même lot documentaire — exactitude, latence, coût | 2 h |
| Jour 2 | ||
| 5 | Travaux pratiques : transcrire des enregistrements fictifs avec Whisper, y ajouter la segmentation par locuteur au moyen d'un modèle de diarisation dédié (pyannote.audio), puis résumer et indexer | 2,5 h |
| 6 | Travaux pratiques : chaîner transcription, extraction d'entités et alimentation d'une base documentaire | 1,5 h |
| 7 | Génération et retouche d'images par modèles de diffusion : usages légitimes, droits, traçabilité et marquage | 1,5 h |
| 8 | Atelier : qualifier trois cas d'usage multimodaux (GED, support, contrôle qualité), estimer gains et risques, puis évaluation des acquis | 1,5 h |
Méthodes pédagogiques
- Pédagogie active : 75 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
Modèles vision-langage, Pixtral, Whisper, pyannote.audio, modèles de diffusion
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
