Descriptif
RAG : construire un assistant sur une base documentaire est une formation de 3 jours (21 heures), de niveau expert, rattachée au domaine « Intelligence artificielle pour l'IT ». Concevoir, évaluer et sécuriser un système de génération augmentée par la recherche. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.
Objectifs pédagogiques
À l'issue de la formation, le participant sera capable de :
- Plongements et bases vectorielles
- Découpage et indexation
- Recherche hybride et reclassement
- Évaluation de la qualité
- Contrôle d'accès et production
Programme détaillé
| N° | Contenus et activités | Durée |
|---|---|---|
| Jour 1 | ||
| 1 | Ouverture : positionnement, présentation du corpus fictif de référence et mise en place des environnements Python | 0,5 h |
| 2 | Plongements vectoriels : espaces, mesures de similarité, dimension, modèles multilingues, coût d'indexation | 1,5 h |
| 3 | Travaux pratiques : calculer et comparer des plongements avec Mistral Embed puis avec un modèle ouvert auto-hébergé | 2 h |
| 4 | Travaux pratiques : stratégies de découpage (taille, recouvrement, découpage sémantique, respect de la structure) et mesure de leur impact | 3 h |
| Jour 2 | ||
| 5 | Bases vectorielles en exploitation : index HNSW, filtrage par métadonnées, mises à jour incrémentales, sauvegarde | 1,5 h |
| 6 | Travaux pratiques : indexer le corpus fictif dans pgvector puis dans Qdrant et comparer rappel et latence | 2,5 h |
| 7 | Travaux pratiques : recherche hybride BM25 et vectorielle, fusion des rangs et reclassement par modèle dédié | 2,5 h |
| 8 | Démonstration commentée : chaînes de question-réponse LangChain et moteurs d'indexation LlamaIndex | 0,5 h |
| Jour 3 | ||
| 9 | Évaluer un RAG : jeu de questions de référence, fidélité, pertinence du contexte, rappel, taux d'abstention | 1,5 h |
| 10 | Travaux pratiques : campagne d'évaluation avec Ragas et analyse des régressions entre deux configurations | 2 h |
| 11 | Travaux pratiques : contrôle d'accès au document, filtrage par habilitation et journalisation des sources citées | 2 h |
| 12 | Mise en situation : industrialiser la réindexation, traiter la dérive du corpus et tenir le budget d'appels | 1 h |
| 13 | Synthèse, évaluation des acquis et plan de mise en production | 0,5 h |
Méthodes pédagogiques
- Pédagogie active : 71 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
- répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
- classe inversée avec prérequis sur le LMS
- apprentissage adaptatif selon le positionnement initial
- travaux en binômes
- classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
- support clair, complet et paginé remis à chaque participant
Technologies et outils mobilisés
LangChain, LlamaIndex, pgvector, Qdrant, Mistral Embed, Ragas
Modalités d'évaluation et de validation
- Positionnement initial en ligne
- quiz de validation à chaque séquence
- évaluation finale des acquis (QCM et mise en situation)
- satisfaction à chaud
- questionnaire de transfert à 30 jours
- attestation de fin de formation
Plateforme, laboratoires et ressources
- LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
- laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
- bibliothèque O'Reilly (plus de 60 000 ressources)
- accès aux supports pendant 6 mois
