advanced · Session 12

Attention Q/K/V : des projections à la sortie causale

Calculer une attention complète : W_Q, W_K, W_V, scores, √d_head, masque causal, softmax, mélange des valeurs, multi-têtes et projection de sortie.

120 min6 mécanismeslaboratoire causal

Ce que vous saurez faire

Ouvrir le laboratoire

Méthode de travail

Travaillez cette session comme une enquête causale. Avant chaque formule ou interaction, écrivez ce que vous pensez voir changer et ce qui doit rester fixe. Pendant le calcul, conservez les unités, les formes et les valeurs intermédiaires : elles permettent de localiser une erreur sans recommencer au hasard. Après le résultat, traduisez le nombre ou l’état en une phrase sur le comportement du système. Terminez toujours par un contre-exemple ou une valeur limite. Cette discipline sépare la compréhension d’un mécanisme de la simple reconnaissance de son vocabulaire et rend le laboratoire reproductible par un autre apprenant.

Construire le mécanisme pas à pas

1. Trois projections apprises

Chaque représentation x produit q=xW_Q, k=xW_K et v=xW_V. La requête exprime ce que la position cherche ; la clé décrit comment elle peut être retrouvée ; la valeur porte l’information à mélanger.

Q=XW_Q, K=XW_K, V=XW_V

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

2. Compatibilité requête-clé

Le produit scalaire q·k mesure l’alignement. Dans « Maya posa le livre… Elle le reprit », une tête peut apprendre que la requête de « Elle » s’aligne avec la clé de « Maya ».

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

3. Mise à l’échelle

Quand d_head augmente, les produits scalaires peuvent devenir grands et saturer la softmax. Diviser par √d_head maintient une échelle plus stable.

S=QKᵀ/√d_head

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

4. Masque causal et softmax

Avant softmax, les positions futures reçoivent −∞. La softmax transforme chaque ligne autorisée en poids positifs qui somment à 1.

A=softmax(S+causal mask)

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

5. Mélange pondéré des valeurs

La sortie est AV : les poids choisissent combien de chaque valeur passe. Les scores ne sont pas eux-mêmes le contenu récupéré.

O=AV

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

6. Multi-têtes, projection et cache

Plusieurs têtes calculent des relations différentes, leurs sorties sont concaténées puis projetées par W_O. En décodage, les K/V passés sont mis en cache ; la nouvelle requête lit ce cache sans recalculer tout le préfixe.

MHA(X)=Concat(head₁…head_h)W_O

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

Cas guidé complet

Trace réduite : q=[2,1], clés k_Maya=[1,1], k_livre=[0,2]. La tête réelle a d_head=4 ; nos vecteurs n’affichent que 2 coordonnées (illustration tronquée), mais la mise à l’échelle garde la vraie dimension. Scores bruts : 3 et 2 ; division par √4=2 donne 1,5 et 1. Softmax ≈ [0,62;0,38]. La sortie mélange 62 % de v_Maya et 38 % de v_livre. Pour une position antérieure, le masque causal supprimerait toute clé future.

Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.

Frontière de validité

Les cartes d’attention ne prouvent pas à elles seules une explication causale du comportement global du modèle.

Statut de preuve: Mécanismes établis ; les simplifications numériques sont pédagogiques.

Vérifications rapides

1. Que fait réellement Trois projections apprises?

Chaque représentation x produit q=xW_Q, k=xW_K et v=xW_V. La requête exprime ce que la position cherche ; la clé décrit comment elle peut être retrouvée ; la valeur porte l’information à mélanger.

2. Que fait réellement Compatibilité requête-clé?

Le produit scalaire q·k mesure l’alignement. Dans « Maya posa le livre… Elle le reprit », une tête peut apprendre que la requête de « Elle » s’aligne avec la clé de « Maya ».

3. Que fait réellement Mise à l’échelle?

Quand d_head augmente, les produits scalaires peuvent devenir grands et saturer la softmax. Diviser par √d_head maintient une échelle plus stable.

4. Que fait réellement Masque causal et softmax?

Avant softmax, les positions futures reçoivent −∞. La softmax transforme chaque ligne autorisée en poids positifs qui somment à 1.

Sources et frontière de preuve

Portée: Mécanismes établis ; les simplifications numériques sont pédagogiques.