Notes formateur: Poser le problème avant de nommer le mécanisme. Recueillir une prédiction initiale et la conserver pour le ticket de sortie.
Notes formateur: Faire relier chaque étape à la suivante par un verbe causal. Signaler toute flèche purement décorative.
Notes formateur: Projeter l’échantillon brut 60 secondes en silence avant toute consigne, puis demander : « qu’est-ce qui vous inquiète ici ? ». Attendu : spam et doublons ; la clé d’API passe souvent inaperçue — la pointer en dernier, c’est le vrai danger.
Notes formateur: Ouvrir avec un échantillon réel non filtré projeté à l’écran (spam, doublon, clé d’API visible). Laisser la salle proposer les règles de rejet avant de nommer « déduplication » et « provenance ».
Notes formateur: Réponse : les 3 000 copies tirent les poids vers la restitution par cœur et peuvent fuiter à l’inférence ; au filtrage, le retrait coûte une comparaison d’empreintes, après l’entraînement il faudrait ré-entraîner. Erreur attendue : « le modèle fera la moyenne tout seul ». Renvoyer à l’erreur fréquente 1.
Notes formateur: Faire estimer la part rejetée avant de dévoiler les nombres — la salle sous-estime presque toujours. Préciser que les proportions sont illustratives ; l’ordre des étages, lui, est réel : on retire le moins cher à détecter d’abord.
Notes formateur: Écrire au tableau « le modèle lit des lettres ? des mots ? » et faire voter. La majorité vote « mots » — parfait : le beat suivant montre que la vraie réponse est « ni l’un ni l’autre ».
Notes formateur: Faire tokeniser la phrase en direct dans un tokenizer en ligne et faire compter les tokens à voix haute. Le désaccord 5 tokens / 4 mots doit venir de leur écran, pas de la diapositive.
Notes formateur: Réponse : « livre » → [ liv][re]. Le coût — mémoire, calcul, facturation — se compte en tokens : +25 % sur cette phrase. Erreur attendue : désigner « Maya » parce qu’un prénom « semble rare » ; faire vérifier dans la trace, Maya tient en un token.
Notes formateur: Demander : « qui a étiqueté le web ? ». Laisser le silence durer, puis faire émerger que le texte s’étiquette lui-même par décalage. C’est le déclic central de la session — y consacrer trois pleines minutes.
Notes formateur: Distribuer quatre cartons [A][B][C][D] et faire physiquement glisser la rangée cible d’un cran. Demander ensuite ce qui tombe du bord : c’est ce qui explique la position perdue.
Notes formateur: Réponse : entrée [A,B,C], cible [B,C,D] ; avec un décalage de 2, D n’a plus de cible et les formes (2,8) ≠ (2,9) font refuser le lot. Erreur attendue : « on remplit la cible avec du PAD » — montrer qu’un PAD-cible entrerait dans la perte et la fausserait.
Notes formateur: Faire estimer : « deux séquences, 4 et 9 positions — combien de cases GPU ? ». Les réponses 13 et 18 coexistent toujours ; garder les deux au tableau, le beat tranche entre elles.
Notes formateur: Faire dessiner le lot 4+9 sur papier quadrillé, cases padées hachurées. Compter ensemble 18 puis 13 cases : le masque devient une évidence visuelle et non une règle à retenir.
Notes formateur: Réponse : T = 9 et 5 positions padées ; sans masque, la moyenne se divise par 18 et baisse artificiellement — c’est l’erreur fréquente 2. Erreur attendue : T = 13, en additionnant les longueurs au lieu de prendre le maximum.
Notes formateur: Faire surligner les cinq cases PAD et écrire « 0 » dessus à la main. Demander ensuite : « que vaut la moyenne si on divise quand même par 18 ? » — plus basse, sans aucun progrès. Le masque devient une évidence.
Notes formateur: Question d’accroche : « le modèle met 1 % sur la bonne réponse — amende légère ou lourde ? ». Faire justifier la réponse avant de montrer la courbe en −log ; les intuitions linéaires vont se faire surprendre.
Notes formateur: Faire tracer −log(p) à la main pour p = 0,5 / 0,25 / 0,01. La pente qui s’envole près de zéro explique à elle seule pourquoi les erreurs confiantes coûtent si cher.
Notes formateur: Réponse : 0,693 pour p = 0,50 et 4,605 pour p = 0,01 ; de 0,25 à 0,01 la pénalité monte de 1,386 à 4,605, soit +3,22. Erreur attendue : raisonner linéairement (« ×25 de probabilité en moins = ×25 de perte ») — la courbe est logarithmique.
Notes formateur: Faire lire la courbe de droite à gauche : « pour diviser la perte par deux, il faut passer de 0,25 à 0,50 — mais de 0,01 à 0,25, on gagne 3,2 ». Les premiers pas d’un modèle rapportent énormément ; les derniers points de perte sont les plus chers.
Notes formateur: Annoncer un faux triomphe : « notre modèle passe de 61 à 89 % ! ». Laisser la fête retomber quand quelqu’un demande d’où viennent les questions du test — si personne ne le demande, c’est le vrai diagnostic de la salle.
Notes formateur: Poser la question du benchmark contaminé comme un cas d’arbitrage, pas comme une définition : « votre modèle passe de 61 à 89 % — quelle vérification faites-vous en premier ? » Laisser le débat courir.
Notes formateur: Réponse : le score du benchmark mesure désormais la mémoire, pas la capacité ; le blocage appartient au filtrage — empreintes croisées corpus/évaluation — tout en haut du schéma. Erreur attendue : « on retire la question après coup » ; le reste du jeu demeure suspect.
Notes formateur: Dérouler ligne par ligne. Une incohérence se localise à la première étape fautive, pas seulement sur la dernière ligne.
Notes formateur: Faire remplir la dernière ligne par les apprenants avant de la révéler : c’est le compromis qui décide en production.
Notes formateur: Conserver les valeurs initiales et finales. Interdire les changements simultanés qui rendent l’écart impossible à attribuer.
Notes formateur: Pour chaque affirmation, faire produire le contre-exemple minimal par le groupe avant de donner la correction.
Notes formateur: Séparer mécanisme vérifiable, choix d’implémentation rapporté et résultat expérimental. La précision de la preuve doit suivre celle de l’affirmation.
Notes formateur: Attendus : (1) filtrage — données personnelles et secret médical, le retrait tardif est impossible ; (2) 200 mots dépassent largement 250 tokens si le jargon se fragmente : +25 à +100 % selon la densité — accepter tout chiffrage argumenté ; (3) un rappel mesurable : taux de duplication, fuite d’identifiants, couverture du vocabulaire sur un échantillon. Idée fausse à récolter : « on durcit l’évaluation d’abord » — sans corpus propre, l’évaluation mesure du bruit. 10 minutes, groupes de trois.
Notes formateur: Faire reconstruire la chaîne sans regarder les slides, puis remplir le ticket en six lignes maximum. Comparer à la prédiction initiale du premier slide et nommer ce qui a réellement changé.