Notes: Accueillir. Annoncer le fil rouge : à la fin de la séance, chacun saura dessiner un pipeline RAG complet et diagnostiquer pourquoi un RAG répond mal. Rappeler que cette session s'appuie directement sur la Session 1 (embeddings).
Notes: LLM = Large Language Model, grand modèle de langage — redéfinir même si le groupe connaît. Chaque objectif correspond à un bloc de la séance.
Notes: Interroger le groupe 30 secondes : « qui peut me redéfinir un embedding ? ». Ce rappel est la fondation de toute la séance — la récupération vectorielle n'est QUE de la géométrie. Sans ça, la suite est du vaudou.
Notes: Laisser le groupe répondre. Les deux issues (aveu d'ignorance / invention plausible) illustrent le problème. Enchaîner : POURQUOI ne peut-il pas savoir ? → slide suivante.
Notes: Analogie : un journal imprimé — excellent le jour J, jamais mis à jour ensuite. Préciser que ré-entraîner un modèle coûte des millions ⚠ : on ne le fait pas pour rafraîchir des faits.
Notes: C'est la limite la plus importante en contexte professionnel. Question au groupe : « quels documents de VOTRE quotidien un modèle n'a jamais vus ? » — faire lister 3-4 exemples concrets, on les réutilisera au bloc chunking.
Notes: C'est la limite la moins intuitive. Conséquence : même sur du public, le modèle peut déformer des détails (dates, chiffres, noms). D'où les hallucinations plausibles. Les trois limites ensemble justifient le RAG.
Notes: Démo en direct si un modèle est disponible hors ligne, sinon captures dans le support. Installer l'expression « examen à mémoire fermée » — le RAG sera « à livre ouvert ».
Notes: LA slide pivot. On ne modifie pas le modèle, on ne le ré-entraîne pas : on enrichit son prompt au moment de la question. Le modèle reste le même — c'est son contexte qui change.
Notes: Objection fréquente à désamorcer tout de suite. Analogie : pour répondre à une question d'examen, on n'apporte pas la bibliothèque entière — on apporte les 3 bonnes fiches.
Notes: Séparation temporelle fondamentale — les participants les confondent systématiquement. L'ingestion se fait SANS utilisateur ; la requête se joue en quelques centaines de millisecondes ⚠.
Notes: Rappel : 1 token ≈ 0,75 mot en anglais, un peu moins en français ⚠. Le mot « chunk » restera en anglais (standard du métier) — le traduire une fois : « morceau ». Les décisions fines de découpage arrivent au bloc C.
Notes: Insister : c'est le MÊME mécanisme qu'en Session 1, appliqué à chaque morceau de document. Un corpus de 10 000 chunks = 10 000 points dans un espace de plusieurs centaines de dimensions ⚠.
Notes: Ne pas entrer dans les détails d'implémentation des bases vectorielles — hors périmètre. Retenir la fonction : recherche des plus proches voisins, rapide, à grande échelle.
Notes: Point conceptuel clé : question et chunks doivent vivre dans le MÊME espace, sinon « proche » ne veut rien dire. Deux modèles d'embedding différents = deux espaces incompatibles. Sur k : petit = risque de rater l'info ; grand = bruit + coût.
Notes: Montrer qu'il n'y a AUCUNE magie : le RAG, c'est de l'assemblage de prompt. Le modèle ne « se connecte » à rien — il lit ce qu'on lui met sous les yeux, rien de plus.
Notes: 5 minutes. Taper « Combien de jours de télétravail par semaine ? ». Avant chaque étape, demander au groupe de PRÉDIRE ce qui va sortir. Terminer par la question piège « politique tarifaire pour les ONG » → refus élégant (teasing du bloc D). Puis pause.
Notes: Reprise après pause. Annoncer la couleur : un RAG médiocre a presque toujours un chunking médiocre. Analogie fil rouge : découper un livre en fiches de révision.
Notes: Faire la démo au visualiseur de chunking (onglet 2) : taille fixe minuscule → phrases orphelines ; puis activer le chevauchement et montrer la zone surlignée cuivre.
Notes: Le fil d'Ariane rend le chunk compréhensible seul ET améliore sa récupération (les mots du titre comptent dans l'embedding). Montrer la stratégie « structurelle » dans le visualiseur : les sections restent entières.
Notes: Exemple volontairement frappant. Dans le visualiseur, la stratégie « taille fixe » coupe le tableau des barèmes en plein milieu — le montrer. Cas réels : grilles tarifaires, matrices de compatibilité, barèmes RH.
Notes: Insister sur la sécurité : le filtre par niveau d'accès s'applique À LA RÉCUPÉRATION, jamais après génération (si le chunk entre dans le prompt, l'info peut fuiter dans la réponse). Les citations = condition de la confiance en entreprise. Lancer l'exercice 1 juste après cette slide.
Notes: Démo choc à l'explorateur de similarité (onglet 3) : cliquer ERR-4471 vs ERR-4472 → similarité quasi 1 alors qu'ils désignent des choses différentes. Autres victimes : noms propres rares, références produit, numéros d'articles de loi.
Notes: BM25 = algorithme classique de recherche par mots-clés (le citer sans le détailler). Message : vectoriel et lexical ne sont pas concurrents mais complémentaires — chacun rattrape les angles morts de l'autre.
Notes: « RAG vanilla » désigne ici le pipeline simple vu jusqu'à présent. La suite est une boîte à outils conditionnelle : on ajoute une étape seulement lorsqu'un jeu de test montre le problème qu'elle corrige.
Notes: Exemple : « Comment ça marche pour les nouveaux ? » devient « conditions de télétravail des nouveaux embauchés », « ancienneté requise pour le télétravail » et « exceptions d'éligibilité ». HyDE peut aider lorsque la question est très courte, mais peut aussi injecter un mauvais angle : toujours comparer sur un jeu de test.
Notes: Le cross-encoder est plus précis mais plus lent : on ne l'applique pas à tout le corpus. Ne pas promettre qu'il améliore toujours le système ; mesurer rappel, précision, latence et coût sur les mêmes requêtes.
Notes: Une note produite par le même modèle n'est pas une preuve externe. La décision doit être calibrée sur un jeu de test annoté : réponses attendues, absences attendues et contradictions connues. Situer les familles sans les confondre : **Corrective RAG** évalue les passages et relance la récupération ; **Adaptive RAG** choisit une route selon la question ; **Self-RAG** produit des signaux de réflexion. Dans les trois cas, une auto-note reste un **signal de routage**, jamais une preuve externe.
Notes: Le bon pipeline n'est pas le plus complexe. C'est le plus simple qui atteint les seuils de qualité, sécurité, latence et coût définis sur un jeu de test représentatif.
Notes: Analogie du cuisinier et du commis : si le commis apporte du sel au lieu du sucre, changer de cuisinier ne sauvera pas le dessert. Éviter un pourcentage non sourcé : l'origine doit être établie incident par incident.
Notes: Ne pas appliquer HyDE ou reranking par réflexe. Si le document n'est pas dans l'index, aucune de ces étapes ne peut le recréer.
Notes: Une réponse propre et citée peut rester périmée. La fraîcheur du corpus est une propriété du système, pas du modèle.
Notes: La porte de preuve décide si l'on peut répondre ; le prompt encadre ensuite la génération. Une auto-évaluation du modèle ne remplace ni les citations vérifiables ni le jeu de test externe.
Notes: Faire reformuler les points 4 à 6 : technique, preuve attendue et coût associé.
Notes: Ne plus annoncer une session RAG inexistante. Le perfectionnement RAG est inclus dans cette session sous forme d'échelle d'intervention et d'exercice diagnostique.