English
Applied AI · IntermĂ©diaire 🟡 · Session 4
📝 Guide du professeur
← Retour au programme 📄 Source .md

Guide du formateur — Session 4 (Niveau intermĂ©diaire)

RAG : donner de la mémoire au modÚle

Programme : Applied AI — Yann Isola DurĂ©e : 2 h 00 Public : professionnels ayant suivi les sessions 1 Ă  3 (embeddings, fenĂȘtre de contexte, prompting) Module source : Module 3, partie 1


1. Objectifs pédagogiques

À la fin de la session, chaque participant doit ĂȘtre capable de :

  1. Expliquer pourquoi la connaissance d’un LLM (Large Language Model, grand modĂšle de langage) est limitĂ©e : figĂ©e Ă  la date de coupure, publique uniquement, stockĂ©e de maniĂšre compressĂ©e et avec pertes dans les poids du modĂšle.
  2. DĂ©crire le principe du RAG (Retrieval-Augmented Generation, c’est-Ă -dire GĂ©nĂ©ration AugmentĂ©e par la RĂ©cupĂ©ration) : transformer chaque question en « examen Ă  livre ouvert ».
  3. Dessiner les deux pipelines : ingestion (hors ligne) et requĂȘte (en ligne), avec leurs Ă©tapes respectives.
  4. Prendre des décisions de découpage (chunking) : taille de chunk, chevauchement, découpe sur la structure, tables entiÚres.
  5. Diagnostiquer un Ă©chec de RAG : distinguer une erreur de rĂ©cupĂ©ration d’une erreur de gĂ©nĂ©ration.
  6. Choisir et Ă©valuer une amĂ©lioration robuste — multi-query, HyDE, reranking ou porte de preuve — sans ignorer latence, coĂ»t ni confidentialitĂ©.

2. Prérequis et matériel

ÉlĂ©ment DĂ©tail
Prérequis participants Session 1 (embeddings : le sens devient géométrie), Session 2-3 (contexte, prompting)
Matériel formateur Vidéoprojecteur, slides de la session, page web interactive webpage/index.html (fonctionne hors ligne)
Matériel participants Ordinateur portable recommandé pour les exercices 2 et 3 (papier possible)
Documents à imprimer Feuille d’exercices (1 par personne), quiz (1 par personne), 6 exit tickets

Vérification avant la séance : ouvrir webpage/index.html dans un navigateur ; tester le simulateur, le visualiseur de chunking et la cascade « RAG robuste ». Aucune connexion Internet requise.


3. Déroulé minuté (120 minutes)

Bloc A — Le problĂšme : une mĂ©moire figĂ©e (0:00 → 0:20, 20 min)

Temps Activité Slides
0:00–0:05 Accueil + rappel express Session 1 : « le sens devient gĂ©omĂ©trie » (embeddings) 1–3
0:05–0:15 Les trois limites de la mĂ©moire d’un LLM 4–7
0:15–0:20 Mini-dĂ©mo : question sur un fait interne fictif → le modĂšle ne peut pas savoir 8

Notes formateur :


Bloc B — Le principe du RAG et les deux pipelines (0:20 → 0:55, 35 min)

Temps Activité Slides
0:20–0:30 DĂ©finition du RAG + vue d’ensemble des deux pipelines 9–11
0:30–0:40 Pipeline d’ingestion (hors ligne) : dĂ©couper → vectoriser → indexer 12–14
0:40–0:50 Pipeline de requĂȘte (en ligne) : vectoriser la question → rĂ©cupĂ©rer k chunks → assembler le prompt → gĂ©nĂ©rer 15–17
0:50–0:55 DĂ©mo interactive : simulateur de pipeline sur la page web 17

Notes formateur :

INGESTION (hors ligne, une fois)
Documents → DĂ©coupage en chunks → Embedding de chaque chunk → Index vectoriel

REQUÊTE (en ligne, à chaque question)
Question → Embedding de la question → Recherche des k chunks les plus proches
        → Assemblage du prompt (instruction + chunks + question) → GĂ©nĂ©ration

Pause (0:55 → 1:05, 10 min)


Bloc C — Les dĂ©cisions de chunking et les mĂ©tadonnĂ©es (1:05 → 1:30, 25 min)

Temps Activité Slides
1:05–1:15 Chunking : taille, chevauchement, structure, tables 18–21
1:15–1:20 MĂ©tadonnĂ©es : source, section, date, niveau d’accĂšs 22
1:20–1:30 Exercice 1 en binĂŽmes : stratĂ©gie de dĂ©coupage d’un document rĂ©el —

Notes formateur :


Bloc D — Recherche hybride, RAG robuste et modes d’échec (1:30 → 1:50, 20 min)

Temps Activité Slides
1:30–1:35 Recherche hybride : vecteurs + mots-clĂ©s 23–24
1:35–1:44 Échelle RAG robuste + cascade interactive 25–29
1:44–1:49 Diagnostic, porte de preuve et refus 30–33
1:49–1:50 DĂ©cision : rĂ©pondre, reformuler ou refuser 33

Notes formateur :


Bloc E — Quiz, synthùse, exit tickets (1:50 → 2:00, 10 min)

Temps Activité
1:50–1:57 Quiz (11 QCM, correction collective rapide ou en autonomie)
1:57–1:59 SynthĂšse : les 6 idĂ©es Ă  retenir
1:59–2:00 Exit tickets

Les 6 idées à retenir (à projeter ou dicter) :

  1. La mĂ©moire d’un LLM est figĂ©e, publique et avec pertes → le RAG rend l’examen « Ă  livre ouvert ».
  2. Deux pipelines : ingestion (hors ligne) et requĂȘte (en ligne).
  3. Le chunking est le levier n°1 : chevauchement, découpe structurelle, tables entiÚres.
  4. Hybride = vecteurs (sens) + mots-clés (exact).
  5. Robuste = reformuler → rĂ©cupĂ©rer large → reranker → vĂ©rifier la preuve.
  6. Quand le RAG Ă©choue, inspecter d’abord les chunks, puis rĂ©pondre ou refuser.

4. Exit tickets (6 questions)

Distribuer un ticket par participant (une seule question chacun, en tournant), rĂ©ponse en 1–2 phrases, ramassage Ă  la sortie. Objectif : mesurer la comprĂ©hension rĂ©elle, pas noter.

Ticket 1. Citez les trois limites de la connaissance d’un modĂšle de langage seul, sans RAG. Attendu : figĂ©e Ă  la date de coupure ; uniquement publique ; stockĂ©e avec pertes dans les poids.

Ticket 2. Quelle est la diffĂ©rence entre le pipeline d’ingestion et le pipeline de requĂȘte ? Quand chacun s’exĂ©cute-t-il ? Attendu : ingestion = hors ligne, prĂ©paration ; requĂȘte = en ligne, Ă  chaque question.

Ticket 3. Pourquoi ne faut-il jamais couper un tableau en deux lors du chunking ? Attendu : une ligne sĂ©parĂ©e de son en-tĂȘte devient inintelligible.

Ticket 4. Votre RAG donne une rĂ©ponse fausse. Quel est votre premier rĂ©flexe de diagnostic ? Attendu : inspecter les chunks rĂ©cupĂ©rĂ©s et vĂ©rifier que le document attendu existe dans l’index.

Ticket 5. Pourquoi combine-t-on recherche vectorielle et recherche par mots-clés ? Attendu : les vecteurs capturent le sens ; le lexical retrouve les codes et chaßnes exactes.

Ticket 6. Pourquoi une auto-Ă©valuation positive du modĂšle ne suffit-elle pas Ă  ouvrir la porte de preuve ? Attendu : le mĂȘme modĂšle peut rĂ©pĂ©ter son erreur ; il faut des citations vĂ©rifiables et des seuils calibrĂ©s sur un jeu de test externe.


5. Difficultés anticipées et parades

Difficulté Parade
« Pourquoi pas juste mettre tous les documents dans le prompt ? » FenĂȘtre limitĂ©e, bruit, latence et coĂ»t. Le RAG sĂ©lectionne le pertinent.
Confusion embedding de chunk / embedding de question MĂȘme modĂšle d’embedding, mĂȘme espace gĂ©omĂ©trique.
« Le fine-tuning ferait pareil » Fine-tuning = comportement, pas faits actualisables avec citations et contrĂŽle d’accĂšs.
« Plus d’étapes = meilleur RAG » Faux : chaque Ă©tape doit corriger un Ă©chec mesurĂ© et respecter les budgets de latence, coĂ»t et confidentialitĂ©.
« Le modĂšle dit que sa rĂ©ponse est fondĂ©e » Une auto-Ă©valuation n’est pas une preuve externe : exiger citations, vĂ©rification et jeu de test annotĂ©.
Sur-optimisme (« le RAG résout les hallucinations ») Il les réduit ; une mauvaise récupération ou génération reste possible.

6. Prolongements (si le groupe est rapide)