Exercices corrigés — Attention Q/K/V : des projections à la sortie causale
Consigne générale: chaque réponse doit montrer les données, la transformation, le résultat, une vérification et une limite. Un nombre seul ou une définition recopiée ne suffit pas.
Données de départ: Trace réduite : q=[2,1], clés k_Maya=[1,1], k_livre=[0,2]. La tête réelle a d_head=4 ; nos vecteurs n’affichent que 2 coordonnées (illustration tronquée), mais la mise à l’échelle garde la vraie dimension. Scores bruts : 3 et 2 ; division par √4=2 donne 1,5 et 1. Softmax ≈ [0,62;0,38]. La sortie mélange 62 % de v_Maya et 38 % de v_livre. Pour une position antérieure, le masque causal supprimerait toute clé future.
Frontière à conserver: Les cartes d’attention ne prouvent pas à elles seules une explication causale du comportement global du modèle.
Exercice 1 — Trace calculée — Trois projections apprises
Reproduisez puis commentez la chaîne Q=XW_Q, K=XW_K, V=XW_V. Augmentez la première composante de q de 2 à 2,4, sans changer les clés. Recalculez les deux scores divisés par √4 et les poids d’attention.
Livrable: un tableau données → opération → résultat → interprétation, plus deux phrases sur la valeur modifiée.
Solution guidée
Trace réduite : q=[2,1], clés k_Maya=[1,1], k_livre=[0,2]. La tête réelle a d_head=4 ; nos vecteurs n’affichent que 2 coordonnées (illustration tronquée), mais la mise à l’échelle garde la vraie dimension. Scores bruts : 3 et 2 ; division par √4=2 donne 1,5 et 1. Softmax ≈ [0,62;0,38]. La sortie mélange 62 % de v_Maya et 38 % de v_livre. Pour une position antérieure, le masque causal supprimerait toute clé future.
Variante résolue: Les scores mis à l’échelle passent de [1,5;1] à [1,7;1]. Les poids softmax passent d’environ [0,622;0,378] à [0,668;0,332] : la clé Maya reçoit davantage de masse, sans devenir une certitude.
Chaque représentation x produit q=xW_Q, k=xW_K et v=xW_V. La requête exprime ce que la position cherche ; la clé décrit comment elle peut être retrouvée ; la valeur porte l’information à mélanger. Le produit scalaire q·k mesure l’alignement. Dans « Maya posa le livre… Elle le reprit », une tête peut apprendre que la requête de « Elle » s’aligne avec la clé de « Maya ». La vérification minimale consiste à contrôler les dimensions, le signe et l’ordre de grandeur. Si la variation obtenue contredit la prédiction, localiser la première opération qui change de sens au lieu de corriger seulement la dernière ligne.
Barème Exercice 1 — /10
| Critère | Points |
|---|---|
| Données et formes explicites | 2 |
| Calcul traçable | 3 |
| Prédiction avant variation | 2 |
| Interprétation et vérification | 2 |
| Limite nommée | 1 |
Exercice 2 — Diagnostic d’une explication séduisante — Mise à l’échelle
Un collègue affirme: « Mise à l’échelle prouve que le système sera exact, rapide et stable dans tous les contextes. »
- Séparez mécanisme, hypothèse, observation et conclusion.
- Citez deux éléments corrects de la leçon et deux extrapolations non justifiées.
- Proposez une expérience bornée avec variable contrôlée, métrique et seuil d’arrêt.
- Réécrivez l’affirmation en une phrase défendable.
Solution argumentée
Quand d_head augmente, les produits scalaires peuvent devenir grands et saturer la softmax. Diviser par √d_head maintient une échelle plus stable. Avant softmax, les positions futures reçoivent −∞. La softmax transforme chaque ligne autorisée en poids positifs qui somment à 1. Les cartes d’attention ne prouvent pas à elles seules une explication causale du comportement global du modèle.
L’affirmation mélange une relation locale et une garantie globale. Une version défendable décrit seulement le mécanisme observé, les conditions du test et la métrique relevée. Le test doit s’arrêter si les formes deviennent invalides, si la métrique se dégrade au-delà du seuil annoncé ou si une autre variable a changé.
Barème Exercice 2 — /10
2 points par élément : séparation, ancrage dans la leçon, extrapolations, protocole, reformulation.
Exercice 3 — Décision d’architecture et transfert — Mélange pondéré des valeurs
Vous devez reproduire le cas guidé « Trace réduite : q=[2,1], clés k_Maya=[1,1], k_livre=[0,2]. La tête réelle a d_head=4 ; nos vecteurs n’affichent que 2 coordonnées (illustration tronquée), mais la mise à l’échelle garde la vraie dimension. Scores bruts : 3 et 2 ; division par √4=2 donne 1,5 et 1. Softmax ≈ [0,62;0,38]. La sortie mélange 62 % de v_Maya et 38 % de v_livre. Pour une position antérieure, le masque causal supprimerait toute clé future. » dans deux conditions. Option A utilise la chaîne complète jusqu’à « Mélange pondéré des valeurs ». Option B est une référence transparente qui conserve « Trois projections apprises », calcule directement la sortie attendue et n’utilise pas le mécanisme de compression ou d’ajustement étudié. Construisez une fiche de décision comportant:
- la charge et la contrainte dominante;
- le mécanisme de chaque option, sans slogan;
- une prédiction qualité, mémoire ou latence;
- un cas où votre procédure préférée perd;
- un protocole A/B, métriques et seuil de retour arrière;
- un verdict borné : choisir, différer ou refuser.
Éléments d’une bonne solution
La sortie est AV : les poids choisissent combien de chaque valeur passe. Les scores ne sont pas eux-mêmes le contenu récupéré. Plusieurs têtes calculent des relations différentes, leurs sorties sont concaténées puis projetées par W_O. En décodage, les K/V passés sont mis en cache ; la nouvelle requête lit ce cache sans recalculer tout le préfixe. Mécanismes établis ; les simplifications numériques sont pédagogiques.
Une bonne réponse ne présente pas le mécanisme récent comme gagnant par défaut. Elle conserve une référence mesurable, fixe le seuil avant le test et distingue le coût du composant du comportement du système complet. Le verdict doit citer ce qui reste incertain et la prochaine preuve qui pourrait le modifier.
Barème Exercice 3 — /15
| Critère | Points |
|---|---|
| Cadrage et référence | 3 |
| Chaînes causales comparées | 4 |
| Protocole et métriques | 4 |
| Seuil de retour arrière | 2 |
| Verdict borné | 2 |
Prolongement
Refaites l’exercice 3 en inversant la contrainte dominante. Si vous aviez optimisé la mémoire, imposez maintenant une qualité minimale stricte; si vous aviez optimisé la fidélité, imposez une enveloppe mémoire divisée par deux. Identifiez le premier point du verdict qui change et la preuve nécessaire.
Relecture avant remise
Relisez votre paquet comme si un autre groupe devait reproduire votre travail sans vous parler. Toutes les valeurs ou hypothèses de départ sont-elles présentes ? Les formes ou rôles sont-ils écrits avant les opérations ? La prédiction précède-t-elle réellement l’observation ? Le résultat est-il traduit en comportement plutôt que laissé comme nombre isolé ? Avez-vous testé une valeur limite et identifié une condition d’arrêt ? Le choix de procédure ou d’architecture conserve-t-il une référence mesurable et un seuil de retour arrière fixé avant le test ? Enfin, surlignez une phrase qui décrit ce qui est établi, une phrase qui reste une hypothèse et une mesure susceptible de changer votre verdict. Si l’un de ces éléments manque, le travail n’est pas reproductible.
Annexe de référence pour la correction
1. Trois projections apprises
Chaque représentation x produit q=xW_Q, k=xW_K et v=xW_V. La requête exprime ce que la position cherche ; la clé décrit comment elle peut être retrouvée ; la valeur porte l’information à mélanger.
Formule de travail:
Q=XW_Q, K=XW_K, V=XW_V
2. Compatibilité requête-clé
Le produit scalaire q·k mesure l’alignement. Dans « Maya posa le livre… Elle le reprit », une tête peut apprendre que la requête de « Elle » s’aligne avec la clé de « Maya ».
3. Mise à l’échelle
Quand d_head augmente, les produits scalaires peuvent devenir grands et saturer la softmax. Diviser par √d_head maintient une échelle plus stable.
Formule de travail:
S=QKᵀ/√d_head
4. Masque causal et softmax
Avant softmax, les positions futures reçoivent −∞. La softmax transforme chaque ligne autorisée en poids positifs qui somment à 1.
Formule de travail:
A=softmax(S+causal mask)
5. Mélange pondéré des valeurs
La sortie est AV : les poids choisissent combien de chaque valeur passe. Les scores ne sont pas eux-mêmes le contenu récupéré.
Formule de travail:
O=AV
6. Multi-têtes, projection et cache
Plusieurs têtes calculent des relations différentes, leurs sorties sont concaténées puis projetées par W_O. En décodage, les K/V passés sont mis en cache ; la nouvelle requête lit ce cache sans recalculer tout le préfixe.
Formule de travail:
MHA(X)=Concat(head₁…head_h)W_O
Sources et frontière de preuve
- Vaswani et al., “Attention Is All You Need”, NeurIPS (2017).
- Dossier source fourni par le propriétaire; les détails sur des produits nommés restent attribués à cette source jusqu’à vérification primaire.
Portée: Mécanismes établis ; les simplifications numériques sont pédagogiques. Ces références soutiennent le cadre de la session; elles ne transforment pas un choix de produit rapporté en résultat indépendant.