advanced · Session 16

Gated DeltaNet et oubli sélectif

Ajouter décroissance et portes d’écriture à une mémoire correctible.

120 min6 mécanismeslaboratoire causal

Ce que vous saurez faire

Ouvrir le laboratoire

Méthode de travail

Travaillez cette session comme une enquête causale. Avant chaque formule ou interaction, écrivez ce que vous pensez voir changer et ce qui doit rester fixe. Pendant le calcul, conservez les unités, les formes et les valeurs intermédiaires : elles permettent de localiser une erreur sans recommencer au hasard. Après le résultat, traduisez le nombre ou l’état en une phrase sur le comportement du système. Terminez toujours par un contre-exemple ou une valeur limite. Cette discipline sépare la compréhension d’un mécanisme de la simple reconnaissance de son vocabulaire et rend le laboratoire reproductible par un autre apprenant.

Construire le mécanisme pas à pas

1. Pourquoi oublier

Le problème : Un document change de sujet au token 500 ; la mémoire delta, elle, garde tout. Les associations de l’ancien sujet continuent de répondre aux requêtes du nouveau — la superposition de la session 13 revient, non par clés proches, mais par simple accumulation dans le temps.

L’idée : Renverser le réflexe : l’oubli est une fonction, pas une panne. Une mémoire de capacité fixe qui ne libère jamais rien finit par ne plus rien distinguer ; effacer l’obsolète est précisément ce qui garde le présent lisible.

Pourquoi / à quel prix : Oublier libère de la capacité et borne l’influence du passé. Le prix, évident mais réel : ce qui est décru est perdu — un fait posé au token 10 et utile au token 10 000 doit avoir été réécrit entre-temps, sinon il n’existe plus.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

2. Porte de décroissance

Le problème : D’accord pour oublier — mais à quelle vitesse ? Un taux figé serait faux partout : un dialogue veut retenir 50 tokens, un contrat 5 000. Il faut un oubli piloté par le contenu, pas par une constante globale.

L’idée : Une porte α_t ∈ [0,1], produite à chaque token, multiplie l’état avant l’écriture : S′ = α_t·S_{t−1}. À 0,8, une trace suit 1 → 0,8 → 0,64, et sa demi-vie vaut ln(0,5)/ln(0,8) ≈ 3,1 tokens. Le modèle apprend quand serrer ou ouvrir la porte.

S_t=α_t S_{t−1}+update_t

Pourquoi / à quel prix : L’oubli devient mesurable — une demi-vie — et contextuel. Le prix : la décroissance est globale. La ligne 2 de la trace, jamais réécrite, décroît quand même ; ce qui n’est pas réécrit régulièrement s’évapore, pertinent ou non.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

3. Porte d’écriture

Le problème : Symétriquement : tout token mérite-t-il d’écrire ? Un « le » redondant qui écrit à pleine force use la capacité et pousse l’état vers l’interférence ; une correction critique écrite timidement ne corrige rien.

L’idée : β_t dose la correction delta : S_t = S′ + β_t k eᵀ. Sur la trace, β = 0,5 n’applique que la moitié de l’erreur — il reste exactement (1−β)·e. β ≈ 0 ignore, β = 1 corrige à fond, décidé token par token.

Pourquoi / à quel prix : Deux portes indépendantes : α décide ce qui reste, β ce qui entre — une commande fine, et apprise. Le prix : deux réglages qui peuvent se compenser ; diagnostiquer « mémoire trop courte » exige de séparer l’effet de α de celui de β.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

4. Stabilité

Le problème : Ces récurrences tournent 100 000 fois de suite. Une porte à 1,05 — 5 % de trop — multiplie l’état par 7 en 40 tokens, par 131 en 100. Et le même code avec l’ordre corriger-puis-décroître produit d’autres nombres : deux modèles pour une même formule.

L’idée : La stabilité tient à des détails contraignants : α borné dans [0,1] — pas seulement |α| ≤ 1, un α négatif ferait osciller le signe —, clés normalisées, et un ordre d’opérations déclaré : décroître, lire, corriger.

Pourquoi / à quel prix : Ces contraintes rendent la récurrence sûre sur des longueurs arbitraires. Le prix : rien n’est cosmétique — une implémentation qui écrit S = αS + βk eᵀ sans préciser l’ordre est irreproductible. Les détails sont l’architecture.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

5. Capacité effective

Le problème : S fait toujours 2×2 — pourtant α = 0,99 et α = 0,80 donnent des mémoires radicalement différentes. Si la taille physique ne bouge pas, que mesure au juste « la mémoire » de ce modèle ?

L’idée : La bonne grandeur est la durée utile : demi-vie ≈ 69 tokens à α = 0,99, ≈ 3,1 à α = 0,80, 1,0 à α = 0,5. La capacité effective combine taille de S, oubli et séparation des clés — pas la longueur maximale affichée du contexte.

Pourquoi / à quel prix : La demi-vie donne un langage honnête pour comparer des mémoires — et pour lire les annonces : « contexte de 1 M de tokens » ne dit rien de ce qui survit 1 000 pas. Le prix : c’est une moyenne ; la rétention réelle dépend des portes apprises, donc du contenu.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

6. Lien avec Mamba

Le problème : Deux familles — SSM (Mamba) et mémoires delta à portes — affichent le même argumentaire : état fixe, portes dépendantes de l’entrée, long contexte. Faut-il en conclure qu’elles sont interchangeables, et benchmarker l’une pour choisir l’autre ?

L’idée : Le recouvrement est réel : récurrence plus contrôles appris. La différence aussi : la mémoire delta LIT son état (v̂ = S′ᵀk) et écrit l’erreur ; un SSM classique filtre le signal sans lecture associative. Même famille de motivations, équations distinctes.

Pourquoi / à quel prix : Le parallèle guide l’intuition et le transfert d’outils (chunking, portes). Le prix de l’analogie facile : des conclusions non transférables — un résultat Mamba ne prouve rien sur Gated DeltaNet, et réciproquement. Comparer exige les deux implémentations, même tâche, même budget.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

Développement depuis la source de cours

Chapitre 11 — Oubli : Gated DeltaNet et lien avec Mamba

11.1 Pourquoi l’oubli est utile

But : empêcher les anciennes informations d’occuper la mémoire pour toujours. Une porte est un nombre appris, souvent compris entre 0 et 1, qui contrôle la quantité d’information transmise.

Un tableau blanc est utile parce qu’on peut effacer partiellement les notes dépassées avant d’en écrire de nouvelles.

Étape par étape

  • Appliquer une décroissance générale : S ← αS, où α proche de 1 signifie se souvenir et α proche de 0 oublier fortement.

  • Appliquer la correction delta ciblée pour la clé actuelle.

  • Utiliser β pour contrôler la force d’écriture.

Exemple détaillé : si S contient 10 et α=0,8, la décroissance laisse 8 avant la nouvelle écriture. Une décroissance répétée de 0,8 donne 10, 8, 6,4, 5,12… L’influence ancienne diminue progressivement.

Pourquoi c’est important : L’oubli est une gestion sélective des ressources. Il peut améliorer la capacité effective lorsque les anciens détails ne sont plus utiles.

Vérification rapide : α=1 efface-t-il la mémoire ? Réponse : non ; il conserve l’ancien état avant la nouvelle écriture.

11.2 Lien avec Mamba

But : situer la mémoire récurrente à portes dans une famille plus large. Mamba est un modèle d’espace d’état sélectif : il transporte un état de taille fixe dans le temps et laisse des contrôles dépendant de l’entrée décider quoi conserver et quoi injecter.

Les deux systèmes ressemblent à une expérience scientifique continue : conserver un état, le faire décroître ou le transformer, ajouter de nouvelles preuves et produire une sortie.

Étape par étape

  • Thème commun : état récurrent de taille fixe.

  • Thème commun : portes apprises dépendant de l’entrée.

  • Différence importante : la mémoire de type Delta utilise explicitement des associations clé-valeur et des corrections ; Mamba est généralement formulé avec des équations d’espace d’état.

Exemple détaillé : Le lien est conceptuel ; il ne signifie pas que les deux architectures sont identiques.

Pourquoi c’est important : Reconnaître les familles aide à comparer les choix de conception sans confondre des mécanismes distincts.

Vérification rapide : quelle est l’idée centrale commune ? Réponse : un état appris de taille fixe, mis à jour à mesure que la séquence avance.

Cas guidé complet

Avec α=0,8, une trace de valeur 1 devient 0,8 puis 0,64 sans nouvelle écriture. Une correction β=0,5 n’ajoute ensuite que la moitié de l’erreur observée.

Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.

Frontière de validité

Le parallèle avec Mamba est conceptuel. Il ne faut pas conclure que Gated DeltaNet et Mamba sont interchangeables.

Statut de preuve: Établis : règle delta, décroissance exponentielle et demi-vies calculées ici. Pédagogiques : les valeurs α, β et les matrices 2×2 de la trace. Rapportés : les choix de portes exacts des modèles nommés.

Vérifications rapides

1. Que fait réellement Pourquoi oublier?

Renverser le réflexe : l’oubli est une fonction, pas une panne. Une mémoire de capacité fixe qui ne libère jamais rien finit par ne plus rien distinguer ; effacer l’obsolète est précisément ce qui garde le présent lisible.

2. Que fait réellement Porte de décroissance?

Une porte α_t ∈ [0,1], produite à chaque token, multiplie l’état avant l’écriture : S′ = α_t·S_{t−1}. À 0,8, une trace suit 1 → 0,8 → 0,64, et sa demi-vie vaut ln(0,5)/ln(0,8) ≈ 3,1 tokens. Le modèle apprend quand serrer ou ouvrir la porte.

3. Que fait réellement Porte d’écriture?

β_t dose la correction delta : S_t = S′ + β_t k eᵀ. Sur la trace, β = 0,5 n’applique que la moitié de l’erreur — il reste exactement (1−β)·e. β ≈ 0 ignore, β = 1 corrige à fond, décidé token par token.

4. Que fait réellement Stabilité?

La stabilité tient à des détails contraignants : α borné dans [0,1] — pas seulement |α| ≤ 1, un α négatif ferait osciller le signe —, clés normalisées, et un ordre d’opérations déclaré : décroître, lire, corriger.

Sources et frontière de preuve

Portée: Établis : règle delta, décroissance exponentielle et demi-vies calculées ici. Pédagogiques : les valeurs α, β et les matrices 2×2 de la trace. Rapportés : les choix de portes exacts des modèles nommés.