Notes formateur: Poser le problème avant de nommer le mécanisme. Recueillir une prédiction initiale et la conserver pour le ticket de sortie.
Notes formateur: Faire relier chaque étape à la suivante par un verbe causal. Signaler toute flèche purement décorative.
Notes formateur: Vote d’ouverture : « 26 Md ou 1,2 Md — lequel dimensionne votre commande de GPU ? ». Garder le décompte affiché : le beat montre que les deux chiffres servent, mais pas au même poste de budget.
Notes formateur: Ouvrir par un vote : « 26 Md ou 1,2 Md — quel chiffre commandez-vous au fournisseur de GPU ? » Les deux chiffres ont un usage, et c’est la confusion entre les deux qui coûte des budgets réels.
Notes formateur: Réponse : la mémoire au chargement suit les 26 Md — tous les experts résident ; les FLOPs par token suivent les 1,2 Md actifs. Erreur attendue, à récolter explicitement : « les 26 Md déterminent les FLOPs ». Les deux chiffres servent, sur deux postes différents.
Notes formateur: Faire entourer la ligne « en mémoire GPU » : c’est elle qui casse l’intuition « MoE = petit modèle ». Revenir à cette ligne au beat communication, quand la latence s’ajoutera au tableau.
Notes formateur: Demander d’abord : « comment VOUS aiguilleriez les tokens ? » — par langue ? par thème ? Les règles proposées sont toutes rigides : c’est le contraste voulu avec l’aiguillage appris du beat.
Notes formateur: Faire calculer le softmax à la main une seule fois, puis effacer les scores et demander de deviner le domaine du token. L’impossibilité de répondre est l’enseignement, pas un échec de l’exercice.
Notes formateur: Réponse : logits [2,1 ; 1,8 ; 1,9] → softmax ≈ [0,391 ; 0,289 ; 0,320] : le top-2 devient E1 et E3 — E3 remplace E2. Et non, le routeur n’a rien « compris » : un score appris a bougé, la décision a basculé. Erreur attendue : chercher une explication sémantique au basculement.
Notes formateur: Question éclair : « pourquoi pas k = 64 ? pourquoi pas k = 1 ? ». Chaque extrême se réfute en une phrase — coût dense d’un côté, gradient fragile de l’autre. Le beat justifie le milieu.
Notes formateur: Distribuer les 8 tokens à 4 apprenants « experts » physiquement dans la salle, avec 5 jetons chacun. Le débordement se vit mieux qu’il ne s’explique.
Notes formateur: Réponse : 0,529/0,921 = 0,574 et 0,392/0,921 = 0,426, avec 0,921 = 0,529 + 0,392. L’expert partagé s’ajoute hors renormalisation — toujours actif, il n’est pas en compétition : il traite tous les tokens. Erreur attendue : renormaliser sur les trois scores.
Notes formateur: Faire jouer la scène avant la formule : 4 apprenants-experts, 5 jetons chacun, 16 affectations à distribuer selon la trace. Le rejet de t6 doit ARRIVER physiquement avant d’être expliqué.
Notes formateur: Ne pas annoncer C = 5 : faire dériver la formule, puis laisser la salle découvrir que E1 en veut 6. Le rejet doit être une surprise calculée par eux.
Notes formateur: Réponse : f = 1,0 → C = 4 : E1 rejette 2 tokens (6 − 4), 16 slots dont 14 remplis (2 vides) ; f = 2,0 → C = 8 : zéro rejet, 32 slots dont 16 utilisés (16 vides). Erreurs attendues : oublier le ceil, ou compter des rejets chez E2-E4 — seul E1 déborde.
Notes formateur: Faire vérifier les comptes ligne par ligne contre la liste d’affectations de la trace, puis demander : « qui décide que c’est t6 qui saute, et pas t1 ? » — l’ordre d’arrivée, une décision d’implémentation, pas de qualité.
Notes formateur: Écrire 6/4/3/3 au tableau et demander : « faut-il forcer 4/4/4/4 ? ». Laisser le débat pour/contre s’installer deux minutes — ce débat est précisément le curseur que le beat formalise.
Notes formateur: Poser le dilemme comme un curseur, pas comme un réglage : « poussez l’équilibrage jusqu’à 4/4/4/4 — qu’avez-vous cassé ? » Faire nommer la perte avant de donner le terme « spécialisation ».
Notes formateur: Réponse : si E1 est réellement le meilleur pour ces tokens, forcer 4/4/4/4 les envoie vers des experts moins bons — la qualité paie l’uniformité. La perte d’équilibrage combat alors la spécialisation utile : c’est un curseur, pas un objectif. Erreur attendue : « l’uniforme est toujours la cible ».
Notes formateur: Faire dessiner les 4 GPU et tracer le trajet complet de t7 (vers E2, vers E4, deux retours). Compter les traversées à voix haute AVANT d’introduire le mot « all-to-all ».
Notes formateur: Faire dessiner les 4 GPU au tableau et tracer le trajet de t7 (E2 puis E4) aller-retour. Compter les flèches à voix haute recadre le débat « MoE = gratuit » en trente secondes.
Notes formateur: Réponse : deux experts distants = deux allers + deux retours = quatre traversées réseau pour UN token ; et le buffer [E, C, d] voyage en entier, padding compris. Les 1,2 Md actifs mesurent le calcul, pas le réseau. Erreur attendue : « moins de FLOPs = plus rapide ».
Notes formateur: Faire multiplier : 8 tokens × 2 experts × 2 sens = 32 traversées pour un seul pas de couche MoE. Puis demander ce qui change si les 4 experts partagent un GPU — tout le beat tient dans cette réponse.
Notes formateur: Dérouler ligne par ligne. Une incohérence se localise à la première étape fautive, pas seulement sur la dernière ligne.
Notes formateur: Faire remplir la dernière ligne par les apprenants avant de la révéler : c’est le compromis qui décide en production.
Notes formateur: Conserver les valeurs initiales et finales. Interdire les changements simultanés qui rendent l’écart impossible à attribuer.
Notes formateur: Pour chaque affirmation, faire produire le contre-exemple minimal par le groupe avant de donner la correction.
Notes formateur: Séparer mécanisme vérifiable, choix d’implémentation rapporté et résultat expérimental. La précision de la preuve doit suivre celle de l’affirmation.
Notes formateur: Réponses : k = 1 → C = ceil(8×1/4 × 1,25) = 3 ; la charge top-1 devient 6/1/1/0 et E1 rejette 3 tokens sur 6 — moins de calcul, plus de casse. f = 1,5 → C = 6 : zéro rejet, mais 24 slots pour 16 affectations = 33 % de padding payé au all-to-all. Conclusion attendue : f achète de la qualité (moins de rejets) en monnaie de padding et de latence ; k achète du calcul en monnaie de robustesse du mélange. Vérifier les pré-enregistrements avant tout calcul. 10 minutes.
Notes formateur: Faire reconstruire la chaîne sans regarder les slides, puis remplir le ticket en six lignes maximum. Comparer à la prédiction initiale du premier slide et nommer ce qui a réellement changé.