Quiz avec réponses — Mixture-of-Experts : routage et capacité
Répondez aux huit questions, puis vérifiez le score. Ouvrez ensuite uniquement les explications nécessaires à la reprise.
1. Résolvez la variante du cas guidé : Augmentez le score du premier expert de 2,1 à 2,52 et gardez [1,8;0,2] pour les autres. Recalculez softmax et vérifiez si le top-2 change.
Afficher la réponse
C. Les poids passent d’environ [0,529;0,392;0,079] à [0,631;0,307;0,062]. Les experts 1 et 2 restent top-2, mais la charge attendue se concentre davantage sur l’expert 1; la capacité et la politique de débordement deviennent plus critiques. La bonne réponse exécute la modification demandée et donne un résultat contrôlable; les autres textes ne ferment pas ce calcul ou cette trace.
2. Quel ordre causal relie correctement les trois premières étapes de « Mixture-of-Experts : routage et capacité » ?
Afficher la réponse
D. Pourquoi des experts → Routeur → Top-k et mélange La chaîne suit la progression enseignée; inverser les étapes fait utiliser une représentation ou un état avant sa production.
3. Si « Top-k et mélange » est retiré, quelle méthode de diagnostic est défendable ?
Afficher la réponse
A. Conserver la même entrée, prédire la première sortie dépendante de « Top-k et mélange », puis comparer la trace avant/après. Une seule intervention et une prédiction préalable permettent d’attribuer l’écart au mécanisme retiré.
4. Quel verdict respecte la frontière de validité de cette session ?
Afficher la réponse
B. Les noms d’activations et nombres exacts d’experts attribués à un modèle nommé restent rapportés par la source tant qu’une preuve primaire n’est pas attachée. La réponse correcte borne la conclusion; les autres transforment une relation locale en garantie globale.
5. Quelle preuve répond le mieux au statut annoncé pour « Mixture-of-Experts : routage et capacité » ?
Afficher la réponse
C. Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source. Une preuve produit ou mécanisme doit rester attribuée et mesurée; disponibilité et complétion ne prouvent pas la valeur.
6. Quand faut-il préférer une référence plus simple à « Équilibrage » ?
Afficher la réponse
D. Quand un test contrôlé montre une qualité équivalente avec moins de mémoire, de latence ou de complexité. Le choix dépend d’un compromis mesuré sur la charge réelle, pas de la nouveauté ni d’une métrique isolée.
7. Un apprenant obtient le bon résultat mais ne peut pas expliquer « Routeur ». Quelle reprise est la plus utile ?
Afficher la réponse
A. Reconstruire la première transformation manquante, annoter ses entrées et sorties, puis tester un cas voisin. La reprise cible la première rupture causale et exige ensuite un transfert, au lieu de récompenser un résultat deviné.
8. Quel livrable démontre réellement l’objectif « Séparer paramètres totaux et actifs. » ?
Afficher la réponse
B. Une trace avec données de départ, transformations, résultat observé, limite et prochaine expérience. Le livrable correct rend le raisonnement reproductible et le verdict révisable par une mesure future.