DATAROCKSTARS
Réf. IA-IT-08Revenir au menu
Catalogue entreprises › Formations informatiques › Intelligence artificielle pour l'IT

Data engineering pour l'IA : bases vectorielles et gestion des données

Préparer, gouverner et servir les données pour les applications d'IA

2 jours · 14 h Niveau intermédiaire Présentiel, distanciel synchrone, hybride Inter · Intra · Sur mesure

Descriptif

Data engineering pour l'IA : bases vectorielles et gestion des données est une formation de 2 jours (14 heures), de niveau intermédiaire, rattachée au domaine « Intelligence artificielle pour l'IT ». Préparer, gouverner et servir les données pour les applications d'IA. Conçue et animée par des praticiens en activité, elle alterne apports ciblés (30 %) et mises en pratique (70 %) sur des laboratoires cloud individuels, avec des cas inspirés des secteurs banque, assurance et services publics. Disponible en inter-entreprises, en intra sur catalogue et en version sur mesure adaptée au contexte de l'entreprise.

Objectifs pédagogiques

À l'issue de la formation, le participant sera capable de :

  • Données pour l'IA
  • Bases vectorielles
  • Pipelines d'ingestion
  • Qualité et gouvernance
  • Sécurité des données

Programme détaillé

N°Contenus et activités Durée
Jour 1
1Ouverture : tour de table, cartographie des sources de données des participants et accès au bac à sable0,5 h
2Les données pour l'IA : formats, métadonnées, documents non structurés, données personnelles et minimisation1,5 h
3Travaux pratiques : construire un pipeline d'ingestion Airflow sur un entrepôt fictif — extraction, nettoyage, découpage3 h
4Travaux pratiques : modéliser et documenter les transformations avec dbt, tests de schéma et de fraîcheur inclus2 h
Jour 2
5Bases vectorielles : pgvector dans PostgreSQL ou moteur dédié Qdrant — critères de choix, exploitation, sauvegarde1,5 h
6Travaux pratiques : indexer les données transformées et gérer mises à jour incrémentales et suppressions (droit à l'effacement)2,5 h
7Travaux pratiques : contrôles de qualité, détection de doublons et suivi de la dérive du corpus2 h
8Atelier : plan de gouvernance — catalogue, traçabilité, droits d'accès, génération de jeux de test fictifs, puis évaluation des acquis1 h

Méthodes pédagogiques

  • Pédagogie active : 75 % du temps en pratique encadrée — laboratoires cloud provisionnés par participant, travaux pratiques guidés, fil rouge applicatif —, le reste en apports structurés, démonstrations commentées, cadrage et évaluation
  • répartition calculée sur le déroulé détaillé de cette formation, et non annoncée de façon uniforme
  • classe inversée avec prérequis sur le LMS
  • apprentissage adaptatif selon le positionnement initial
  • travaux en binômes
  • classe virtuelle en séquences de 3 h 30 maximum sur Microsoft Teams
  • support clair, complet et paginé remis à chaque participant

Technologies et outils mobilisés

Airflow, dbt, pgvector, Qdrant

Modalités d'évaluation et de validation

  • Positionnement initial en ligne
  • quiz de validation à chaque séquence
  • évaluation finale des acquis (QCM et mise en situation)
  • satisfaction à chaud
  • questionnaire de transfert à 30 jours
  • attestation de fin de formation

Plateforme, laboratoires et ressources

  • LMS DATAROCKSTARS : parcours, supports numériques, quiz, évaluations, émargement par demi-journée
  • laboratoires cloud individuels accessibles depuis un navigateur, sans installation, données fictives, détruits en fin de session
  • bibliothèque O'Reilly (plus de 60 000 ressources)
  • accès aux supports pendant 6 mois

Fiche mise à jour le 21/09/2026 — version 1.0. Les programmes sont révisés chaque trimestre et à chaque évolution majeure des technologies, normes ou référentiels de certification concernés.