Notes formateur: Poser le problème avant de nommer le mécanisme. Recueillir une prédiction initiale et la conserver pour le ticket de sortie.
Notes formateur: Faire relier chaque étape à la suivante par un verbe causal. Signaler toute flèche purement décorative.
Notes formateur: Ouvrir par la facture : « votre PM veut 131 072 tokens de contexte — combien de mémoire par requête ? ». Recueillir trois estimations avant tout calcul ; l’écart entre les réponses et 16 Gio structure toute la séance.
Notes formateur: Faire poser le calcul au tableau facteur par facteur, sans calculatrice, jusqu’à 128 Kio/token. Puis demander de doubler d_head à voix haute : le réflexe « quel facteur bouge » est l’objectif de la diapositive.
Notes formateur: Réponse : 32 × 2 × 8 × 128 × 2 = 131 072 o — couches × (K et V) × têtes × d_head × octets/valeur. En INT8, le dernier facteur passe de 2 à 1 : 64 Kio/token. Erreur attendue : « INT8 supprime un facteur » — non, il le divise par deux ; aucun facteur ne disparaît.
Notes formateur: Rappel éclair des sessions 13-16 en une question : « quelle taille fait S après un million de tokens ? ». La réponse « la même » doit fuser de la salle — sinon, refaire soixante secondes de session 13 avant d’avancer.
Notes formateur: Demander avant tout commentaire : « à 524 288 tokens, combien pèse l’état ? » La réponse « toujours 1 Mio » doit venir de la salle, pas de l’instructeur — c’est ce qui rend le compromis crédible ensuite.
Notes formateur: Réponse : la qualité du rappel se dégrade (interférence accumulée), pas la mémoire ; on le remarque quand une lecture ancienne revient mélangée — d’où un test de rappel contrôlé, pas un moniteur de RAM. Erreur attendue : « rien ne se dégrade puisque la taille est constante ».
Notes formateur: Question d’accroche : « peut-on payer moins par token sans renoncer au par-token ? ». Laisser la salle formuler l’espace du compromis — fidélité structurée contre coefficient — avant de prononcer « MLA ».
Notes formateur: Faire tracer la flèche du schéma au feutre : qu’est-ce qui est stocké, qu’est-ce qui est recalculé ? Tant que la salle n’a pas désigné c_t seul, ne pas avancer.
Notes formateur: Réponse : on déplace de la mémoire (cache 4× plus étroit) vers du calcul (reconstruction via W_UK/W_UV à chaque lecture) ; le surcoût pèse surtout au décodage, où chaque nouveau token relit tout le cache. Erreur attendue : « au préfill » — le préfill est déjà dominé par le calcul.
Notes formateur: Écrire 16 777 216 au tableau et demander : « couper W en deux matrices, ça gagne toujours ? ». Faire voter oui/non ; le vote prépare la découverte du seuil r = 2048 dans le beat.
Notes formateur: Donner r = 2048 sans le commenter et laisser le groupe découvrir le zéro gain. L’échec calculé vaut mieux que la règle énoncée ; ensuite seulement, faire dériver le seuil.
Notes formateur: Réponse : coût factorisé r(d+m) < d·m ⇔ r < d·m/(d+m) ; avec d = m = 4096, r* = 4096/2 = 2048, et à r = 2048 l’égalité est exacte : zéro gain. Erreur attendue : croire le seuil à d/2 « par hasard » — faire refaire avec d = 4096, m = 1024 (r* ≈ 819).
Notes formateur: Faire calculer la ligne r = 1024 par la salle avant de l’afficher, puis demander r* pour d = 4096, m = 1024 (≈ 819) : le seuil dépend des DEUX dimensions, pas d’une règle « moitié ».
Notes formateur: Relire les deux annonces côte à côte : « cache compressé 4× » et « mémoire constante ». Demander qui budgète quoi à 524 288 tokens — les erreurs de budget récoltées sont le contenu du beat.
Notes formateur: Provoquer explicitement l’erreur : demander un vote à main levée sur « MLA est-il à mémoire fixe ? » avant de montrer les 4 Gio → 16 Gio. Le vote rend la correction mémorable.
Notes formateur: Réponse : un gain constant — un facteur ÷4 sur une croissance qui reste linéaire ; l’ordre O(n) est inchangé. Erreur attendue : « asymptotique, puisque 4× moins à toute longueur » — c’est précisément la définition d’un gain constant. Renvoyer au support visuel : deux droites, coefficients différents.
Notes formateur: Faire lire la table en diagonale : la case MLA à 524 288 égale la case standard à 131 072. Demander ensuite : « quelle ligne changerait si on passait c ÷ 8 ? » — seules les deux droites bougent, jamais la plate.
Notes formateur: Afficher W ≈ AB seul, sans contexte, et demander : « architecture ou adaptation ? ». L’impossibilité de répondre sans contexte EST la leçon du beat — la formuler explicitement à la fin.
Notes formateur: Écrire W ≈ AB une seule fois au tableau et faire annoter deux colonnes : « entraîné depuis zéro / greffé sur gelé », « inamovible / fusionnable ». La même algèbre, deux colonnes : c’est tout le message.
Notes formateur: Réponse : l’adaptation LoRA est retirable — un delta posé à côté de poids gelés ; W_DKV et W_UK sont le chemin avant du modèle, les retirer le casse. Erreur attendue : confondre « LoRA peut être fusionné » (choix) avec « LoRA est indispensable » (faux), et l’inverse pour MLA.
Notes formateur: Masquer les en-têtes de colonnes et faire deviner, ligne par ligne, de quel côté chaque case appartient. Les hésitations sur « retirable ? » sont le vrai diagnostic de compréhension.
Notes formateur: Dérouler ligne par ligne. Une incohérence se localise à la première étape fautive, pas seulement sur la dernière ligne.
Notes formateur: Faire remplir la dernière ligne par les apprenants avant de la révéler : c’est le compromis qui décide en production.
Notes formateur: Conserver les valeurs initiales et finales. Interdire les changements simultanés qui rendent l’écart impossible à attribuer.
Notes formateur: Pour chaque affirmation, faire produire le contre-exemple minimal par le groupe avant de donner la correction.
Notes formateur: Séparer mécanisme vérifiable, choix d’implémentation rapporté et résultat expérimental. La précision de la preuve doit suivre celle de l’affirmation.
Notes formateur: Réponses : d_head ×2 → 256 Kio/token et 32 Gio (qualité potentiellement touchée : têtes plus larges) ; c ÷2 → 16 Kio/token et 2 Gio (qualité touchée : reconstruction plus contrainte) ; longueur ÷2 → coût par token INCHANGÉ, mémoire 8 Gio (qualité touchée seulement si le contenu utile dépasse la fenêtre). Erreur à récolter : « diviser la longueur divise le coût par token ». Vérifier que chaque binôme a pré-enregistré avant de calculer. 10 minutes.
Notes formateur: Faire reconstruire la chaîne sans regarder les slides, puis remplir le ticket en six lignes maximum. Comparer à la prédiction initiale du premier slide et nommer ce qui a réellement changé.