1. Pourquoi oublier
Le problème : Un document change de sujet au token 500 ; la mémoire delta, elle, garde tout. Les associations de l’ancien sujet continuent de répondre aux requêtes du nouveau — la superposition de la session 13 revient, non par clés proches, mais par simple accumulation dans le temps.
L’idée : Renverser le réflexe : l’oubli est une fonction, pas une panne. Une mémoire de capacité fixe qui ne libère jamais rien finit par ne plus rien distinguer ; effacer l’obsolète est précisément ce qui garde le présent lisible.
Pourquoi / à quel prix : Oublier libère de la capacité et borne l’influence du passé. Le prix, évident mais réel : ce qui est décru est perdu — un fait posé au token 10 et utile au token 10 000 doit avoir été réécrit entre-temps, sinon il n’existe plus.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
2. Porte de décroissance
Le problème : D’accord pour oublier — mais à quelle vitesse ? Un taux figé serait faux partout : un dialogue veut retenir 50 tokens, un contrat 5 000. Il faut un oubli piloté par le contenu, pas par une constante globale.
L’idée : Une porte α_t ∈ [0,1], produite à chaque token, multiplie l’état avant l’écriture : S′ = α_t·S_{t−1}. À 0,8, une trace suit 1 → 0,8 → 0,64, et sa demi-vie vaut ln(0,5)/ln(0,8) ≈ 3,1 tokens. Le modèle apprend quand serrer ou ouvrir la porte.
S_t=α_t S_{t−1}+update_t
Pourquoi / à quel prix : L’oubli devient mesurable — une demi-vie — et contextuel. Le prix : la décroissance est globale. La ligne 2 de la trace, jamais réécrite, décroît quand même ; ce qui n’est pas réécrit régulièrement s’évapore, pertinent ou non.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
3. Porte d’écriture
Le problème : Symétriquement : tout token mérite-t-il d’écrire ? Un « le » redondant qui écrit à pleine force use la capacité et pousse l’état vers l’interférence ; une correction critique écrite timidement ne corrige rien.
L’idée : β_t dose la correction delta : S_t = S′ + β_t k eᵀ. Sur la trace, β = 0,5 n’applique que la moitié de l’erreur — il reste exactement (1−β)·e. β ≈ 0 ignore, β = 1 corrige à fond, décidé token par token.
Pourquoi / à quel prix : Deux portes indépendantes : α décide ce qui reste, β ce qui entre — une commande fine, et apprise. Le prix : deux réglages qui peuvent se compenser ; diagnostiquer « mémoire trop courte » exige de séparer l’effet de α de celui de β.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
4. Stabilité
Le problème : Ces récurrences tournent 100 000 fois de suite. Une porte à 1,05 — 5 % de trop — multiplie l’état par 7 en 40 tokens, par 131 en 100. Et le même code avec l’ordre corriger-puis-décroître produit d’autres nombres : deux modèles pour une même formule.
L’idée : La stabilité tient à des détails contraignants : α borné dans [0,1] — pas seulement |α| ≤ 1, un α négatif ferait osciller le signe —, clés normalisées, et un ordre d’opérations déclaré : décroître, lire, corriger.
Pourquoi / à quel prix : Ces contraintes rendent la récurrence sûre sur des longueurs arbitraires. Le prix : rien n’est cosmétique — une implémentation qui écrit S = αS + βk eᵀ sans préciser l’ordre est irreproductible. Les détails sont l’architecture.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
5. Capacité effective
Le problème : S fait toujours 2×2 — pourtant α = 0,99 et α = 0,80 donnent des mémoires radicalement différentes. Si la taille physique ne bouge pas, que mesure au juste « la mémoire » de ce modèle ?
L’idée : La bonne grandeur est la durée utile : demi-vie ≈ 69 tokens à α = 0,99, ≈ 3,1 à α = 0,80, 1,0 à α = 0,5. La capacité effective combine taille de S, oubli et séparation des clés — pas la longueur maximale affichée du contexte.
Pourquoi / à quel prix : La demi-vie donne un langage honnête pour comparer des mémoires — et pour lire les annonces : « contexte de 1 M de tokens » ne dit rien de ce qui survit 1 000 pas. Le prix : c’est une moyenne ; la rétention réelle dépend des portes apprises, donc du contenu.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
6. Lien avec Mamba
Le problème : Deux familles — SSM (Mamba) et mémoires delta à portes — affichent le même argumentaire : état fixe, portes dépendantes de l’entrée, long contexte. Faut-il en conclure qu’elles sont interchangeables, et benchmarker l’une pour choisir l’autre ?
L’idée : Le recouvrement est réel : récurrence plus contrôles appris. La différence aussi : la mémoire delta LIT son état (v̂ = S′ᵀk) et écrit l’erreur ; un SSM classique filtre le signal sans lecture associative. Même famille de motivations, équations distinctes.
Pourquoi / à quel prix : Le parallèle guide l’intuition et le transfert d’outils (chunking, portes). Le prix de l’analogie facile : des conclusions non transférables — un résultat Mamba ne prouve rien sur Gated DeltaNet, et réciproquement. Comparer exige les deux implémentations, même tâche, même budget.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
Développement depuis la source de cours
Chapitre 11 — Oubli : Gated DeltaNet et lien avec Mamba
11.1 Pourquoi l’oubli est utile
But : empêcher les anciennes informations d’occuper la mémoire pour toujours. Une porte est un nombre appris, souvent compris entre 0 et 1, qui contrôle la quantité d’information transmise.
Un tableau blanc est utile parce qu’on peut effacer partiellement les notes dépassées avant d’en écrire de nouvelles.
Étape par étape
-
Appliquer une décroissance générale : S ← αS, où α proche de 1 signifie se souvenir et α proche de 0 oublier fortement.
-
Appliquer la correction delta ciblée pour la clé actuelle.
-
Utiliser β pour contrôler la force d’écriture.
Exemple détaillé : si S contient 10 et α=0,8, la décroissance laisse 8 avant la nouvelle écriture. Une décroissance répétée de 0,8 donne 10, 8, 6,4, 5,12… L’influence ancienne diminue progressivement.
Pourquoi c’est important : L’oubli est une gestion sélective des ressources. Il peut améliorer la capacité effective lorsque les anciens détails ne sont plus utiles.
Vérification rapide : α=1 efface-t-il la mémoire ? Réponse : non ; il conserve l’ancien état avant la nouvelle écriture.
11.2 Lien avec Mamba
But : situer la mémoire récurrente à portes dans une famille plus large. Mamba est un modèle d’espace d’état sélectif : il transporte un état de taille fixe dans le temps et laisse des contrôles dépendant de l’entrée décider quoi conserver et quoi injecter.
Les deux systèmes ressemblent à une expérience scientifique continue : conserver un état, le faire décroître ou le transformer, ajouter de nouvelles preuves et produire une sortie.
Étape par étape
-
Thème commun : état récurrent de taille fixe.
-
Thème commun : portes apprises dépendant de l’entrée.
-
Différence importante : la mémoire de type Delta utilise explicitement des associations clé-valeur et des corrections ; Mamba est généralement formulé avec des équations d’espace d’état.
Exemple détaillé : Le lien est conceptuel ; il ne signifie pas que les deux architectures sont identiques.
Pourquoi c’est important : Reconnaître les familles aide à comparer les choix de conception sans confondre des mécanismes distincts.
Vérification rapide : quelle est l’idée centrale commune ? Réponse : un état appris de taille fixe, mis à jour à mesure que la séquence avance.
Cas guidé complet
Avec α=0,8, une trace de valeur 1 devient 0,8 puis 0,64 sans nouvelle écriture. Une correction β=0,5 n’ajoute ensuite que la moitié de l’erreur observée.
Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.