advanced · Session 17

Kimi Delta Attention : étude de cas bornée

Étudier une combinaison rapportée de correction delta, décroissance par canal et calcul chunkwise sans transformer les chiffres produit en faits établis.

120 min6 mécanismeslaboratoire causal

Ce que vous saurez faire

Ouvrir le laboratoire

Méthode de travail

Travaillez cette session comme une enquête causale. Avant chaque formule ou interaction, écrivez ce que vous pensez voir changer et ce qui doit rester fixe. Pendant le calcul, conservez les unités, les formes et les valeurs intermédiaires : elles permettent de localiser une erreur sans recommencer au hasard. Après le résultat, traduisez le nombre ou l’état en une phrase sur le comportement du système. Terminez toujours par un contre-exemple ou une valeur limite. Cette discipline sépare la compréhension d’un mécanisme de la simple reconnaissance de son vocabulaire et rend le laboratoire reproductible par un autre apprenant.

Construire le mécanisme pas à pas

1. Mécanisme établi

Le problème : Une annonce produit mêle tout : équations, choix d’assemblage, benchmarks. Si vous ne savez pas séparer ce qui est démontrable au crayon de ce qui est déclaré, vous enseignez — ou achetez — un communiqué de presse.

L’idée : Premier tri : le noyau de KDA s’étudie sans produit. Lire-comparer-corriger (session 14) plus une porte d’oubli (session 16) — chaque nombre de cette partie se recalcule ici, au tableau.

Pourquoi / à quel prix : Ce socle vérifiable voyage partout : il restera vrai quel que soit le sort du produit. Le prix : il ne dit rien des choix d’échelle réels — combien de couches, quels ratios — et c’est précisément là que commence le « rapporté ».

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

2. Décroissance par canal

Le problème : Un α scalaire impose la même demi-vie à tout l’état : garder longtemps le nom du client ET oublier vite la météo est impossible avec un seul bouton.

L’idée : Remplacer le scalaire par un vecteur : a = [0,9 ; 0,2], S′ = diag(a)·S. Le canal 1 retient — demi-vie ln(0,5)/ln(0,9) ≈ 6,6 tokens — quand le canal 2 purge (≈ 0,43) : un rapport de 15× dans le même état.

Pourquoi / à quel prix : La finesse est réelle et vérifiable. Le prix aussi : d_k portes par token au lieu d’une — 128 valeurs à produire et à borner pour d_k = 128 — et un axe de débogage en plus : quel canal retient quoi ne se lit plus d’un coup d’œil.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

3. Correction delta

Le problème : Corriger et retenir se confondent facilement : une équipe croit qu’une écriture « réussie » est une écriture durable. Que devient une correction exacte posée sur un canal qui oublie vite ?

L’idée : La trace le chiffre : correction β=1 sur le canal 2 → exactement [4,4] ; deux pas de porte 0,2 plus tard : 4×0,2² = 0,160. La correction a réussi ET la valeur a disparu — « corrigé » et « conservé » sont deux propriétés indépendantes.

Pourquoi / à quel prix : La composition delta + oubli évite l’accumulation brute (session 13) comme l’inertie totale. Le prix : le destin d’une écriture dépend du canal où elle tombe — mêmes β et valeurs, résultats opposés (0,160 contre 3,240 sur le canal 1).

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

4. Exécution chunkwise

Le problème : L’annonce vante un « préfill parallèle chunkwise ». Faut-il compter cela comme un argument de qualité du modèle ? La session 15 a la réponse — encore faut-il penser à l’appliquer.

L’idée : Le chunkwise transporte l’état de bloc en bloc et parallélise l’intérieur — démontré EXACT en session 15 (o₅ = [3,5] avec ou sans chunks). C’est une stratégie d’exécution : elle change le coût, jamais les nombres.

Pourquoi / à quel prix : Vitesse réelle, qualité inchangée — « chunkwise » dans une annonce est donc un argument de débit, pas de qualité. Le prix de la confusion : des comparatifs qui attribuent au mécanisme des gains venus d’ailleurs.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

5. Rapporté par la source

Le problème : Le document fourni attribue à une architecture « K3-style » des comptes de couches, des ratios KDA/attention et des performances. Vous n’avez ni le protocole ni la réplication. Quel statut donner à ces informations en cours ?

L’idée : Le statut exact : « rapporté ». La source primaire est un rapport technique du fournisseur (Kimi Linear, arXiv:2510.26692 — à vérifier) : citable, informatif, non répliqué indépendamment ici. L’information circule avec son étiquette, ni supprimée ni blanchie.

Pourquoi / à quel prix : Étiqueter permet d’enseigner le réel sans le certifier. Le prix : la discipline — chaque phrase du cours porte son statut, et un rapport fournisseur prouve l’existence de l’affirmation, pas du résultat.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

6. Habitude de preuve

Le problème : En réunion, les trois registres fusionnent en une phrase : « KDA décroît par canal, K3 l’empile 3:1, et ça bat la référence de X % ». Répétée telle quelle, la phrase blanchit les deux derniers tiers.

L’idée : L’habitude : séparer systématiquement (a) l’équation vérifiable, (b) le choix d’implémentation rapporté, (c) le résultat expérimental — et exiger une preuve proportionnée à la précision de chaque affirmation.

Pourquoi / à quel prix : Le tri coûte trois secondes par phrase et prévient des mois d’architecture fondée sur un benchmark non répliqué. Le prix social : dire « rapporté, non répliqué » en réunion demande plus de courage qu’un slide de citations.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

Développement depuis la source de cours

Chapitre 12 — Kimi Delta Attention

12.1 Décroissance par canal

But : rendre l’oubli plus précis. Un canal est une coordonnée d’une représentation apprise. Un seul scalaire α traite tous les canaux de la même façon ; un vecteur de décroissances peut les traiter différemment.

Au lieu d’un seul variateur pour tout un bâtiment, donne un variateur à chaque pièce.

Étape par étape

  • Soit le vecteur de décroissance a=[0,9; 0,2].

  • Si une ligne de mémoire vaut [10,10], la décroissance par canal donne [9,2].

  • Le premier canal conserve l’information ; le second se renouvelle rapidement.

  • Le modèle apprend les contrôles de décroissance à partir des données.

Exemple détaillé : Différents canaux peuvent se spécialiser dans des motifs ayant des durées utiles différentes, comme la syntaxe locale ou le thème général.

Pourquoi c’est important : La décroissance par canal augmente la flexibilité, mais aussi la complexité de l’implémentation et de l’optimisation.

Vérification rapide : si la décroissance d’un canal est proche de zéro, que se passe-t-il ? Réponse : son ancien contenu est presque entièrement oublié avant la nouvelle mise à jour.

12.2 Ce que nous pouvons affirmer prudemment

But : séparer le mécanisme des spécifications produit incertaines. Kimi Delta Attention, abrégé KDA, est décrit comme combinant des mises à jour associatives de type delta, une décroissance apprise plus fine et un calcul par blocs adapté au matériel.

Traite les descriptions d’architecture comme une carte avec des niveaux de confiance : les routes vérifiées par des sources primaires sont pleines ; les rumeurs sont en pointillés.

Étape par étape

  • Fondation établie : opérations matricielles, prédiction causale, état récurrent, portes et correction delta.

  • Affirmation dépendant de la source : la manière exacte dont un modèle Kimi nommé combine ces composants.

  • Les détails non vérifiés — nombre exact de couches, d’experts ou résultats de benchmarks — doivent être contrôlés dans un rapport officiel ou du code publié.

Exemple détaillé : La valeur pédagogique de KDA reste claire sans croire chaque chiffre produit : il montre comment une mémoire compressée peut devenir plus sélective et corrigible.

Pourquoi c’est important : Ce cours décrira l’architecture au niveau soutenu par la source fournie et signalera les détails incertains au lieu de les inventer.

Vérification rapide : faut-il traiter un benchmark annoncé comme une identité mathématique ? Réponse : non. Il dépend de la version du modèle, du protocole, du matériel et de la méthode de mesure.

Cas guidé complet

Pour une porte vectorielle [0,9;0,2], le premier canal conserve presque toute sa trace tandis que le second oublie rapidement. La même correction delta peut donc avoir des effets temporels différents par canal.

Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.

Frontière de validité

Les spécifications exactes de Kimi K3 ne sont pas revendiquées comme vérifiées dans cette leçon ; le rapport technique du fournisseur (Kimi Linear, arXiv:2510.26692, à vérifier) est cité sans réplication indépendante.

Statut de preuve: Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source.

Vérifications rapides

1. Que fait réellement Mécanisme établi?

Premier tri : le noyau de KDA s’étudie sans produit. Lire-comparer-corriger (session 14) plus une porte d’oubli (session 16) — chaque nombre de cette partie se recalcule ici, au tableau.

2. Que fait réellement Décroissance par canal?

Remplacer le scalaire par un vecteur : a = [0,9 ; 0,2], S′ = diag(a)·S. Le canal 1 retient — demi-vie ln(0,5)/ln(0,9) ≈ 6,6 tokens — quand le canal 2 purge (≈ 0,43) : un rapport de 15× dans le même état.

3. Que fait réellement Correction delta?

La trace le chiffre : correction β=1 sur le canal 2 → exactement [4,4] ; deux pas de porte 0,2 plus tard : 4×0,2² = 0,160. La correction a réussi ET la valeur a disparu — « corrigé » et « conservé » sont deux propriétés indépendantes.

4. Que fait réellement Exécution chunkwise?

Le chunkwise transporte l’état de bloc en bloc et parallélise l’intérieur — démontré EXACT en session 15 (o₅ = [3,5] avec ou sans chunks). C’est une stratégie d’exécution : elle change le coût, jamais les nombres.

Sources et frontière de preuve

Portée: Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source.