# Quiz avec réponses — Mixture-of-Experts : routage et capacité

### Question 1

Résolvez la variante du cas guidé : Augmentez le score du premier expert de 2,1 à 2,52 et gardez [1,8;0,2] pour les autres. Recalculez softmax et vérifiez si le top-2 change.

- A. Exemple de routage réduit à trois experts pour le calcul : scores [2,1;1,8;0,2] donnent après softmax environ [0,529;0,392;0,079]. Avec top-2, experts 1 et 2 sont actifs. Si l’expert 1 a déjà atteint sa capacité, le routeur doit appliquer la politique de débordement.
- B. Les noms d’activations et nombres exacts d’experts attribués à un modèle nommé restent rapportés par la source tant qu’une preuve primaire n’est pas attachée.
- C. Les poids passent d’environ [0,529;0,392;0,079] à [0,631;0,307;0,062]. Les experts 1 et 2 restent top-2, mais la charge attendue se concentre davantage sur l’expert 1; la capacité et la politique de débordement deviennent plus critiques.
- D. Le routeur est une petite projection : h_t → un logit par expert. Exemple de calcul sur 3 experts : [2,1 ; 1,8 ; 0,2] → softmax [0,529 ; 0,392 ; 0,079]. Ces scores sont des décisions apprises par la perte globale — pas des catégories humaines.

**Réponse: C.** Les poids passent d’environ [0,529;0,392;0,079] à [0,631;0,307;0,062]. Les experts 1 et 2 restent top-2, mais la charge attendue se concentre davantage sur l’expert 1; la capacité et la politique de débordement deviennent plus critiques. La bonne réponse exécute la modification demandée et donne un résultat contrôlable; les autres textes ne ferment pas ce calcul ou cette trace.

---

### Question 2

Quel ordre causal relie correctement les trois premières étapes de « Mixture-of-Experts : routage et capacité » ?

- A. Top-k et mélange → Routeur → Pourquoi des experts
- B. Routeur → Pourquoi des experts → Top-k et mélange
- C. Pourquoi des experts → Top-k et mélange → Routeur
- D. Pourquoi des experts → Routeur → Top-k et mélange

**Réponse: D.** Pourquoi des experts → Routeur → Top-k et mélange La chaîne suit la progression enseignée; inverser les étapes fait utiliser une représentation ou un état avant sa production.

---

### Question 3

Si « Top-k et mélange » est retiré, quelle méthode de diagnostic est défendable ?

- A. Conserver la même entrée, prédire la première sortie dépendante de « Top-k et mélange », puis comparer la trace avant/après.
- B. Changer aussi les données pour amplifier la différence.
- C. Observer uniquement la dernière sortie et inventer la cause.
- D. Conclure que le système entier échoue avant toute mesure.

**Réponse: A.** Conserver la même entrée, prédire la première sortie dépendante de « Top-k et mélange », puis comparer la trace avant/après. Une seule intervention et une prédiction préalable permettent d’attribuer l’écart au mécanisme retiré.

---

### Question 4

Quel verdict respecte la frontière de validité de cette session ?

- A. Le mécanisme garantit exactitude, vitesse et stabilité pour toute charge.
- B. Les noms d’activations et nombres exacts d’experts attribués à un modèle nommé restent rapportés par la source tant qu’une preuve primaire n’est pas attachée.
- C. Un exemple réussi prouve la supériorité de l’architecture complète.
- D. Le nom du mécanisme suffit pour choisir la production.

**Réponse: B.** Les noms d’activations et nombres exacts d’experts attribués à un modèle nommé restent rapportés par la source tant qu’une preuve primaire n’est pas attachée. La réponse correcte borne la conclusion; les autres transforment une relation locale en garantie globale.

---

### Question 5

Quelle preuve répond le mieux au statut annoncé pour « Mixture-of-Experts : routage et capacité » ?

- A. La route charge sans erreur.
- B. Tous les apprenants ont ouvert le fichier.
- C. Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source.
- D. Le même résultat est supposé sur tout matériel.

**Réponse: C.** Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source. Une preuve produit ou mécanisme doit rester attribuée et mesurée; disponibilité et complétion ne prouvent pas la valeur.

---

### Question 6

Quand faut-il préférer une référence plus simple à « Équilibrage » ?

- A. Jamais : le mécanisme le plus récent gagne par défaut.
- B. Dès qu’une seule métrique mémoire baisse, quelle que soit la qualité.
- C. Dès que le diagramme contient moins de composants.
- D. Quand un test contrôlé montre une qualité équivalente avec moins de mémoire, de latence ou de complexité.

**Réponse: D.** Quand un test contrôlé montre une qualité équivalente avec moins de mémoire, de latence ou de complexité. Le choix dépend d’un compromis mesuré sur la charge réelle, pas de la nouveauté ni d’une métrique isolée.

---

### Question 7

Un apprenant obtient le bon résultat mais ne peut pas expliquer « Routeur ». Quelle reprise est la plus utile ?

- A. Reconstruire la première transformation manquante, annoter ses entrées et sorties, puis tester un cas voisin.
- B. Valider la réponse puisque le nombre final est correct.
- C. Donner le résultat final une seconde fois.
- D. Changer plusieurs variables et demander une intuition.

**Réponse: A.** Reconstruire la première transformation manquante, annoter ses entrées et sorties, puis tester un cas voisin. La reprise cible la première rupture causale et exige ensuite un transfert, au lieu de récompenser un résultat deviné.

---

### Question 8

Quel livrable démontre réellement l’objectif « Séparer paramètres totaux et actifs. » ?

- A. Une liste de termes sans relation causale.
- B. Une trace avec données de départ, transformations, résultat observé, limite et prochaine expérience.
- C. Une capture d’écran sans valeurs ni interprétation.
- D. Une affirmation confiante sans référence ni seuil.

**Réponse: B.** Une trace avec données de départ, transformations, résultat observé, limite et prochaine expérience. Le livrable correct rend le raisonnement reproductible et le verdict révisable par une mesure future.
