Applied AI · advanced · Session 20
Exercices corrigés — Flux résiduels et attention sur la profondeur
← Retour au programmeEnglishSource .md

Exercices corrigés — Flux résiduels et attention sur la profondeur

Consigne générale: chaque réponse doit montrer les données, la transformation, le résultat, une vérification et une limite. Un nombre seul ou une définition recopiée ne suffit pas.

Données de départ: Scores de profondeur [2;1;0] sur {x₂₄;x₁₂;x₀} donnent softmax ≈ [0,67;0,24;0,09]. Le mélange privilégie x₂₄, le checkpoint le plus récent, tandis que les deux autres conservent ensemble 33 %.

Frontière à conserver: AttnRes est présenté comme mécanisme de cours et étude de cas rapportée ; ses détails exacts dans Kimi K3 nécessitent une source primaire.

Exercice 1 — Trace calculée — Connexion résiduelle

Reproduisez puis commentez la chaîne x_{l+1}=x_l+F_l(x_l). Augmentez le score du troisième checkpoint de 2 à 2,4 dans [0;1;2]. Recalculez les poids softmax sur la profondeur.

Livrable: un tableau données → opération → résultat → interprétation, plus deux phrases sur la valeur modifiée.

Solution guidée

Scores de profondeur [2;1;0] sur {x₂₄;x₁₂;x₀} donnent softmax ≈ [0,67;0,24;0,09]. Le mélange privilégie x₂₄, le checkpoint le plus récent, tandis que les deux autres conservent ensemble 33 %.

Variante résolue: Les poids passent d’environ [0,090;0,245;0,665] à [0,068;0,184;0,748]. La récupération se concentre davantage sur le troisième checkpoint, tout en conservant une contribution non nulle des deux autres.

L’addition change tout : x_{l+1} = x_l + F_l(x_l). Chaque couche AJOUTE sa transformation au flux au lieu de le remplacer ; si F ≡ 0, x traverse inchangé — le chemin identité garantit un gradient direct vers chaque couche. Sous l’hypothèse de contributions à peu près orthogonales (‖F_l‖ = 0,5), l’énergie suit ‖x_l‖² ≈ 1 + 0,25·l : la part de x₀ passe de 100 % à 25 % (l = 12), 14,3 % (l = 24), 7,7 % (l = 48). Diluée, jamais effacée — l’addition est conservatrice. La vérification minimale consiste à contrôler les dimensions, le signe et l’ordre de grandeur. Si la variation obtenue contredit la prédiction, localiser la première opération qui change de sens au lieu de corriger seulement la dernière ligne.

Barème Exercice 1 — /10

Critère Points
Données et formes explicites 2
Calcul traçable 3
Prédiction avant variation 2
Interprétation et vérification 2
Limite nommée 1

Exercice 2 — Diagnostic d’une explication séduisante — États de profondeur

Un collègue affirme: « États de profondeur prouve que le système sera exact, rapide et stable dans tous les contextes. »

  1. Séparez mécanisme, hypothèse, observation et conclusion.
  2. Citez deux éléments corrects de la leçon et deux extrapolations non justifiées.
  3. Proposez une expérience bornée avec variable contrôlée, métrique et seuil d’arrêt.
  4. Réécrivez l’affirmation en une phrase défendable.
Solution argumentée

La solution : photographier en route. Conserver quelques x_j choisis — {x₀, x₁₂, x₂₄} — comme points de récupération le long de la profondeur, analogues informationnels des checkpoints d’entraînement. Le mécanisme de la session 12, tourné de 90° : une requête de la couche courante score les états conservés — scores [2 ; 1 ; 0] sur {x₂₄ ; x₁₂ ; x₀} → softmax [0,665 ; 0,245 ; 0,090] — puis mélange les valeurs. La récupération se choisit, elle ne se subit plus. AttnRes est présenté comme mécanisme de cours et étude de cas rapportée ; ses détails exacts dans Kimi K3 nécessitent une source primaire.

L’affirmation mélange une relation locale et une garantie globale. Une version défendable décrit seulement le mécanisme observé, les conditions du test et la métrique relevée. Le test doit s’arrêter si les formes deviennent invalides, si la métrique se dégrade au-delà du seuil annoncé ou si une autre variable a changé.

Barème Exercice 2 — /10

2 points par élément : séparation, ancrage dans la leçon, extrapolations, protocole, reformulation.

Exercice 3 — Décision d’architecture et transfert — Blocage

Vous devez reproduire le cas guidé « Scores de profondeur [2;1;0] sur {x₂₄;x₁₂;x₀} donnent softmax ≈ [0,67;0,24;0,09]. Le mélange privilégie x₂₄, le checkpoint le plus récent, tandis que les deux autres conservent ensemble 33 %. » dans deux conditions. Option A utilise la chaîne complète jusqu’à « Blocage ». Option B est une référence transparente qui conserve « Connexion résiduelle », calcule directement la sortie attendue et n’utilise pas le mécanisme de compression ou d’ajustement étudié. Construisez une fiche de décision comportant:

Éléments d’une bonne solution

Regrouper : un checkpoint par bloc de 12 couches → 4 états, 128 Mio (÷12). La granularité devient un curseur — 48, 12, 4 ou 1 états : de « quasi redondant » à « plus aucun choix ». Lecture bornée : 0,665 mesure l’influence de x₂₄ dans CE module, à CETTE couche, pour CE token. Le chemin résiduel transporte x₂₄ de toute façon, et des poids parfaitement lisibles peuvent accompagner un module qui n’explique rien — le cas [0,333…] le prouve. Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source.

Une bonne réponse ne présente pas le mécanisme récent comme gagnant par défaut. Elle conserve une référence mesurable, fixe le seuil avant le test et distingue le coût du composant du comportement du système complet. Le verdict doit citer ce qui reste incertain et la prochaine preuve qui pourrait le modifier.

Barème Exercice 3 — /15

Critère Points
Cadrage et référence 3
Chaînes causales comparées 4
Protocole et métriques 4
Seuil de retour arrière 2
Verdict borné 2

Prolongement

Refaites l’exercice 3 en inversant la contrainte dominante. Si vous aviez optimisé la mémoire, imposez maintenant une qualité minimale stricte; si vous aviez optimisé la fidélité, imposez une enveloppe mémoire divisée par deux. Identifiez le premier point du verdict qui change et la preuve nécessaire.

Relecture avant remise

Relisez votre paquet comme si un autre groupe devait reproduire votre travail sans vous parler. Toutes les valeurs ou hypothèses de départ sont-elles présentes ? Les formes ou rôles sont-ils écrits avant les opérations ? La prédiction précède-t-elle réellement l’observation ? Le résultat est-il traduit en comportement plutôt que laissé comme nombre isolé ? Avez-vous testé une valeur limite et identifié une condition d’arrêt ? Le choix de procédure ou d’architecture conserve-t-il une référence mesurable et un seuil de retour arrière fixé avant le test ? Enfin, surlignez une phrase qui décrit ce qui est établi, une phrase qui reste une hypothèse et une mesure susceptible de changer votre verdict. Si l’un de ces éléments manque, le travail n’est pas reproductible.

Annexe de référence pour la correction

Chapitre 15 — Dilution résiduelle et Attention Residuals

15.1 Flux résiduels

But : comprendre comment les Transformers profonds conservent et mettent à jour l’information. Une connexion résiduelle ajoute la modification d’une couche à la représentation actuelle : x_next = x + F(x).

Chaque éditeur conserve le brouillon actuel et ajoute une révision au lieu de repartir d’une page blanche.

Étape par étape

Exemple détaillé : Dans un réseau très profond, mélanger continuellement toutes les informations dans un seul flux peut rendre certains signaux anciens difficiles à retrouver. Le récit fourni appelle cela dilution résiduelle.

Pourquoi c’est important : Les connexions résiduelles facilitent l’optimisation, mais ne garantissent pas que chaque caractéristique ancienne reste également accessible.

Vérification rapide : si x=[3,1] et F(x)=[−1,2], que vaut x+F(x) ? Réponse : [2,3].

15.2 Attention sur la profondeur

But : permettre à une couche de choisir parmi des représentations antérieures, au lieu d’accepter seulement le dernier flux accumulé. Attention Residuals, abrégé AttnRes, utilise une pondération de type attention sur la profondeur.

Un chercheur compare plusieurs brouillons enregistrés et choisit les passages les plus pertinents pour la prochaine révision.

Étape par étape

Exemple détaillé : trois états de profondeur sont h₁=[1,0], h₂=[0,2], h₃=[3,1]. Les poids [0,2; 0,3; 0,5] donnent 0,2h₁+0,3h₂+0,5h₃ = [1,7; 1,1].

Pourquoi c’est important : L’attention sur la profondeur coûte du stockage et du calcul. Blockwise AttnRes réduit ce coût en conservant ou consultant des points de contrôle plus grossiers plutôt que la sortie de chaque couche.

Vérification rapide : à combien s’additionnent les poids AttnRes après softmax ? Réponse : 1.

15.3 Limite des preuves

But : éviter de traiter un schéma architectural comme une spécification publiée. L’espacement exact des points de contrôle, les équations et l’emplacement des couches doivent être vérifiés dans la source officielle Kimi K3.

Un dessin conceptuel d’un bâtiment explique l’idée, mais ne constitue pas le plan d’ingénierie final.

Étape par étape

Exemple détaillé : Cette distinction garde le cours utile même si de futures publications modifient les noms ou les chiffres.

Pourquoi c’est important : Lire scientifiquement signifie distinguer ce qui est dérivé, mesuré ou seulement rapporté.

Vérification rapide : quelle source doit trancher un désaccord sur l’implémentation exacte ? Réponse : le code officiel ou un rapport technique faisant autorité pour la version précise du modèle.

Sources et frontière de preuve

Portée: Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source. Ces références soutiennent le cadre de la session; elles ne transforment pas un choix de produit rapporté en résultat indépendant.