1. Trois projections apprises
Chaque représentation x produit q=xW_Q, k=xW_K et v=xW_V. La requête exprime ce que la position cherche ; la clé décrit comment elle peut être retrouvée ; la valeur porte l’information à mélanger.
Q=XW_Q, K=XW_K, V=XW_V
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
2. Compatibilité requête-clé
Le produit scalaire q·k mesure l’alignement. Dans « Maya posa le livre… Elle le reprit », une tête peut apprendre que la requête de « Elle » s’aligne avec la clé de « Maya ».
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
3. Mise à l’échelle
Quand d_head augmente, les produits scalaires peuvent devenir grands et saturer la softmax. Diviser par √d_head maintient une échelle plus stable.
S=QKᵀ/√d_head
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
4. Masque causal et softmax
Avant softmax, les positions futures reçoivent −∞. La softmax transforme chaque ligne autorisée en poids positifs qui somment à 1.
A=softmax(S+causal mask)
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
5. Mélange pondéré des valeurs
La sortie est AV : les poids choisissent combien de chaque valeur passe. Les scores ne sont pas eux-mêmes le contenu récupéré.
O=AV
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
6. Multi-têtes, projection et cache
Plusieurs têtes calculent des relations différentes, leurs sorties sont concaténées puis projetées par W_O. En décodage, les K/V passés sont mis en cache ; la nouvelle requête lit ce cache sans recalculer tout le préfixe.
MHA(X)=Concat(head₁…head_h)W_O
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
Cas guidé complet
Trace réduite : q=[2,1], clés k_Maya=[1,1], k_livre=[0,2]. La tête réelle a d_head=4 ; nos vecteurs n’affichent que 2 coordonnées (illustration tronquée), mais la mise à l’échelle garde la vraie dimension. Scores bruts : 3 et 2 ; division par √4=2 donne 1,5 et 1. Softmax ≈ [0,62;0,38]. La sortie mélange 62 % de v_Maya et 38 % de v_livre. Pour une position antérieure, le masque causal supprimerait toute clé future.
Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.