DATAROCKSTARS
Réf. IA-IT-17Revenir au menu
Catalogue entreprises › Formations informatiques › Intelligence artificielle pour l'IT

IA multimodale : texte, image, audio et documents

Exploiter les modèles multimodaux pour traiter documents, images et audio

2 jours · 14 h Niveau expert Présentiel, distanciel synchrone, hybride Inter · Intra · Sur mesure

Descriptif

IA multimodale : texte, image, audio et documents est une formation de 2 jours (14 heures), de niveau expert, rattachée au domaine « Intelligence artificielle pour l'IT ». Exploiter les modèles multimodaux pour traiter documents, images et audio. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.

Objectifs pédagogiques

À l'issue de la formation, le participant sera capable de :

  • Modèles vision-langage
  • Analyse de documents
  • Audio et transcription
  • Génération d'images
  • Cas d'usage

Programme détaillé

N°Contenus et activités Durée
Jour 1
1Ouverture : cas d'usage documents, images et audio apportés par les participants, accès aux modèles0,5 h
2Modèles vision-langage : encodage des images, résolution, limites, hallucinations visuelles, coût par page1,5 h
3Travaux pratiques : extraire des données structurées de factures et de formulaires fictifs avec un modèle vision-langage3 h
4Travaux pratiques : comparer Pixtral et un modèle ouvert de vision sur le même lot documentaire — exactitude, latence, coût2 h
Jour 2
5Travaux pratiques : transcrire des enregistrements fictifs avec Whisper, y ajouter la segmentation par locuteur au moyen d'un modèle de diarisation dédié (pyannote.audio), puis résumer et indexer2,5 h
6Travaux pratiques : chaîner transcription, extraction d'entités et alimentation d'une base documentaire1,5 h
7Génération et retouche d'images par modèles de diffusion : usages légitimes, droits, traçabilité et marquage1,5 h
8Atelier : qualifier trois cas d'usage multimodaux (GED, support, contrôle qualité), estimer gains et risques, puis évaluation des acquis1,5 h

Méthodes pédagogiques

  • Pédagogie active : 75 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
  • répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
  • classe inversée avec prérequis sur le LMS
  • apprentissage adaptatif selon le positionnement initial
  • travaux en binômes
  • classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
  • support clair, complet et paginé remis à chaque participant

Technologies et outils mobilisés

Modèles vision-langage, Pixtral, Whisper, pyannote.audio, modèles de diffusion

Modalités d'évaluation et de validation

  • Positionnement initial en ligne
  • quiz de validation à chaque séquence
  • évaluation finale des acquis (QCM et mise en situation)
  • satisfaction à chaud
  • questionnaire de transfert à 30 jours
  • attestation de fin de formation

Plateforme, laboratoires et ressources

  • LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
  • laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
  • bibliothèque O'Reilly (plus de 60 000 ressources)
  • accès aux supports pendant 6 mois

Fiche mise à jour le 21/09/2026 — version 1.0. Les programmes sont révisés chaque trimestre et à chaque évolution majeure des technologies, normes ou référentiels de certification concernés.