Applied AI · advanced · Session 19
Guide du professeur — Mixture-of-Experts : routage et capacité
← Retour au programmeEnglishSource .md

Guide du professeur — Mixture-of-Experts : routage et capacité

Durée: 120 minutes
Positionnement: Suivre scores de routeur, top-k, experts partagés/routés, capacité et communication.
Preuve attendue: Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source.

Résultats observables et préparation

Avant la séance, le formateur exécute lui-même le cas guidé et le laboratoire, imprime le paquet d’exercices, prépare un tableau à quatre colonnes — hypothèse, prédiction, observation, écart — et vérifie que chaque notation mathématique est accompagnée de ses dimensions. La démonstration ne doit pas devenir une lecture de slides.

Diagnostic

  1. Expliquez en une phrase: Pourquoi des experts. Quelle observation rendrait votre explication fausse ?
  2. Expliquez en une phrase: Routeur. Quelle observation rendrait votre explication fausse ?
  3. Expliquez en une phrase: Top-k et mélange. Quelle observation rendrait votre explication fausse ?

Décision pédagogique: si deux réponses sur trois restent nominales ou sans condition de validité, reprendre le vocabulaire avec un exemple numérique avant toute formule. Une réponse fluide mais non falsifiable n’est pas considérée comme acquise.

Plan minuté

Temps Activité Preuve observable
0–10 min Diagnostic individuel, puis comparaison en binôme Trois réponses et une incertitude nommée
10–25 min Mise en situation et vocabulaire Schéma entrée → état → sortie annoté
25–55 min Développement du mécanisme au tableau Formes, hypothèses et calcul intermédiaire visibles
55–75 min Cas guidé, erreurs volontairement introduites Correction argumentée, pas seulement le bon nombre
75–95 min Laboratoire causal : prédire, modifier une variable, exécuter Tableau prédiction / observation / écart
95–112 min Exercices 1 et 2, correction croisée Production conservée et barème appliqué
112–120 min Ticket de sortie et transfert Mécanisme, frontière, prochaine expérience

Notes pédagogiques

Chapitre 14 — Mélange d’experts

14.1 Routeur et experts

But : offrir au modèle de nombreux spécialistes possibles sans exécuter chaque spécialiste pour chaque jeton. Mixture-of-Experts s’abrège MoE.

Un hôpital possède de nombreux spécialistes, mais l’accueil envoie chaque patient seulement vers les médecins les plus pertinents.

Étape par étape

Exemple détaillé : les scores de quatre experts sont [0,1; 2,0; 1,5; −0,2]. Le routage top-2 choisit les experts 2 et 3. Après un softmax sur ces deux scores, leurs sorties sont mélangées ; les experts 1 et 4 n’effectuent aucun travail spécifique pour ce jeton.

Pourquoi c’est important : MoE peut augmenter la capacité totale en paramètres tout en gardant le calcul actif par jeton bien inférieur à l’exécution de tous les experts.

Vérification rapide : s’il existe 64 experts avec un routage top-2, combien d’experts routés s’exécutent pour un jeton ? Réponse : 2, auxquels s’ajoutent les éventuels experts partagés toujours actifs.

14.2 Équilibrage de charge et communication

But : comprendre pourquoi le routage n’est pas gratuit. Si la plupart des jetons choisissent un seul expert, cet expert devient surchargé tandis que les autres attendent.

Un supermarché avec dix caisses reste lent si tout le monde fait la queue à la même caisse.

Étape par étape

Exemple détaillé : Une architecture offrant de fortes économies arithmétiques peut rester lente si le routage provoque un trafic réseau important.

Pourquoi c’est important : Les performances réelles dépendent du placement matériel, de la taille des lots, des noyaux et de la communication, pas seulement du nombre de paramètres.

Vérification rapide : qu’est-ce que le déséquilibre de charge ? Réponse : le travail est réparti de façon inégale ; certains experts sont surchargés et d’autres sous-utilisés.

14.3 SiLU, unités à porte et réserve sur SiTU

But : comprendre la base avant une activation propre à la source. La Sigmoid Linear Unit, SiLU, vaut SiLU(a)=a×sigmoid(a). Une unité à porte courante multiplie SiLU(a) par une autre branche b, coordonnée par coordonnée.

Une branche décide de l’ouverture de la porte ; l’autre transporte l’information.

Étape par étape

Exemple détaillé : La source fournie nomme une activation SiTU. En l’absence d’une équation officielle ou d’une implémentation publiée, considère sa formule exacte et son avantage annoncé comme dépendants de la source, et non comme des faits établis.

Pourquoi c’est important : Comprendre la base permet d’évaluer toute modification proposée.

Vérification rapide : dans une unité à porte, que signifie multiplication élément par élément ? Réponse : multiplier les coordonnées correspondantes, et non chaque coordonnée par toutes les autres.

Conduite du cas guidé

Exemple de routage réduit à trois experts pour le calcul : scores [2,1;1,8;0,2] donnent après softmax environ [0,529;0,392;0,079]. Avec top-2, experts 1 et 2 sont actifs. Si l’expert 1 a déjà atteint sa capacité, le routeur doit appliquer la politique de débordement.

Ne révélez pas le résultat en une fois. Faites annoncer la prochaine opération, sa forme et le signe attendu. Après chaque ligne, demandez : « Qu’est-ce qui a changé ? Qu’est-ce qui est resté fixe ? Quelle hypothèse avons-nous utilisée ? » Une erreur de calcul corrigée avec une chaîne causale vaut davantage qu’un résultat deviné.

Protocole du laboratoire

  1. Écrire une prédiction qualitative et, si possible, numérique avant de toucher le contrôle.
  2. Modifier une seule variable; garder une capture ou relever les valeurs initiales et finales.
  3. Expliquer l’écart avec le mécanisme, pas avec « l’outil a fait cela ».
  4. Tester une valeur limite et dire où la maquette cesse de représenter un système réel.

Idées fausses

# Idée fausse observable Correction ancrée Relance
1 « Pourquoi des experts suffit à garantir le résultat, sans hypothèse ni mesure. » Le MoE découple les deux : E sous-réseaux (experts) existent, k seulement s’activent par token. Dans la trace : 64 experts routés + 1 partagé = 26 Md de paramètres, mais (2+1) × 0,4 = 1,2 Md actifs par token — un ratio ≈ 21×. Demander un contre-exemple, puis faire reformuler le mécanisme avec sa condition de validité.
2 « Routeur suffit à garantir le résultat, sans hypothèse ni mesure. » Le routeur est une petite projection : h_t → un logit par expert. Exemple de calcul sur 3 experts : [2,1 ; 1,8 ; 0,2] → softmax [0,529 ; 0,392 ; 0,079]. Ces scores sont des décisions apprises par la perte globale — pas des catégories humaines. Demander un contre-exemple, puis faire reformuler le mécanisme avec sa condition de validité.
3 « Top-k et mélange suffit à garantir le résultat, sans hypothèse ni mesure. » Top-k tranche : k = 2 experts par token, poids renormalisés — 0,529 et 0,392 deviennent 0,574 et 0,426 (division par 0,921). Un expert partagé, toujours actif, complète : sortie = Σ poids × expert + partagé + résiduel. Demander un contre-exemple, puis faire reformuler le mécanisme avec sa condition de validité.

Frontière à maintenir: Les noms d’activations et nombres exacts d’experts attribués à un modèle nommé restent rapportés par la source tant qu’une preuve primaire n’est pas attachée.

Questions de relance

  1. Si nous supprimons ou inversons Pourquoi des experts, quelle sortie change en premier, et quelle observation le montrerait ?
  2. Si nous supprimons ou inversons Routeur, quelle sortie change en premier, et quelle observation le montrerait ?
  3. Si nous supprimons ou inversons Top-k et mélange, quelle sortie change en premier, et quelle observation le montrerait ?
  4. Si nous supprimons ou inversons Capacité, quelle sortie change en premier, et quelle observation le montrerait ?
  5. Si nous supprimons ou inversons Équilibrage, quelle sortie change en premier, et quelle observation le montrerait ?
  6. Si nous supprimons ou inversons Communication, quelle sortie change en premier, et quelle observation le montrerait ?

Évaluation

Niveau Critère
0 Répète des termes sans relier entrée, transformation et sortie.
1 Décrit la chaîne mais ne vérifie ni forme ni hypothèse.
2 Exécute le cas, explique le résultat et nomme une limite.
3 Transfère sur un cas inédit, compare une alternative et propose une mesure qui pourrait invalider son choix.

Seuil de sortie : niveau 2 sur le cas guidé et au moins un exercice; une formule mémorisée sans interprétation reste niveau 1.

Protocole d’observation et de reprise

Pendant les échanges, le formateur relève des preuves et non des impressions. Une preuve de compréhension contient un objet nommé, une transformation justifiée et une conséquence vérifiable. Si un apprenant donne le bon résultat sans chaîne, demander de reconstruire la ligne précédente. S’il donne une chaîne cohérente avec un résultat faux, conserver la chaîne et isoler l’erreur de calcul. S’il emploie le vocabulaire d’un autre concept, faire comparer les deux mécanismes dans un tableau entrée, état, sortie, coût et limite. La reprise se fait sur la première rupture seulement : vocabulaire, formes, opération, interprétation ou portée de l’affirmation. Après correction, proposer un cas voisin avec une valeur différente; la réussite sur le même exemple ne prouve pas le transfert. Pour le travail en binôme, attribuer les rôles « opérateur » et « vérificateur », puis les inverser. Le vérificateur ne donne pas la réponse : il exige une hypothèse, contrôle la forme et demande quelle observation pourrait contredire le raisonnement. Le formateur conserve le ticket de sortie et classe la rupture dominante. La séance suivante commence par un problème de trois minutes ciblant cette rupture, plutôt que par une répétition générale du cours.

Différenciation

Suivi après la séance

Dans les vingt-quatre heures, renvoyer à chaque apprenant son ticket annoté avec une seule priorité, la ressource précise à rouvrir et un mini-cas différent du cas guidé. La reprise demande trois éléments : une prédiction écrite, une trace conservée et une phrase expliquant l’écart. Au cours suivant, échantillonner deux productions : une qui a réparé la rupture et une qui reste ambiguë. Les discuter sans nommer les auteurs, puis faire expliciter le critère qui distingue les deux. Ne pas utiliser le taux de complétion comme preuve de maîtrise. La preuve de reprise est une chaîne correcte sur un cas nouveau, accompagnée d’une limite. Si la même rupture apparaît chez plus d’un tiers du groupe, corriger le support ou la démonstration avant d’attribuer le problème aux apprenants.

Le suivi est clos seulement lorsque la nouvelle production montre la chaîne causale, la vérification et la frontière, et non lorsque le fichier a simplement été rendu.

Sources et frontière de preuve

Portée: Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source. Ces références soutiennent le cadre de la session; elles ne transforment pas un choix de produit rapporté en résultat indépendant.

Ticket de sortie

En six lignes maximum : mécanisme; calcul ou trace; observation; frontière; niveau de preuve; prochaine expérience. Le formateur annote une seule rupture causale prioritaire pour la reprise.