# Exercices corrigés — Gated DeltaNet et oubli sélectif

**Consigne générale:** chaque réponse doit montrer les données, la transformation, le résultat, une vérification et une limite. Un nombre seul ou une définition recopiée ne suffit pas.

> **Données de départ:** Avec α=0,8, une trace de valeur 1 devient 0,8 puis 0,64 sans nouvelle écriture. Une correction β=0,5 n’ajoute ensuite que la moitié de l’erreur observée.
>
> **Frontière à conserver:** Le parallèle avec Mamba est conceptuel. Il ne faut pas conclure que Gated DeltaNet et Mamba sont interchangeables.

## Exercice 1 — Trace calculée — Pourquoi oublier

Reproduisez puis commentez la chaîne `S_t=α_t S_{t−1}+update_t`. Augmentez α de 0,8 à 0,96 pour une trace initiale de 1 sans nouvelle écriture. Calculez les deux états suivants et comparez la rétention.

**Livrable:** un tableau données → opération → résultat → interprétation, plus deux phrases sur la valeur modifiée.

<details><summary>Solution guidée</summary>

Avec α=0,8, une trace de valeur 1 devient 0,8 puis 0,64 sans nouvelle écriture. Une correction β=0,5 n’ajoute ensuite que la moitié de l’erreur observée.

**Variante résolue:** Avec α=0,8, la trace donne 0,8 puis 0,64. Avec α=0,96, elle donne 0,96 puis 0,9216. La rétention augmente nettement, mais un α proche de 1 ralentit aussi l’oubli d’informations devenues inutiles.

Renverser le réflexe : l’oubli est une fonction, pas une panne. Une mémoire de capacité fixe qui ne libère jamais rien finit par ne plus rien distinguer ; effacer l’obsolète est précisément ce qui garde le présent lisible. Une porte α_t ∈ [0,1], produite à chaque token, multiplie l’état avant l’écriture : S′ = α_t·S_{t−1}. À 0,8, une trace suit 1 → 0,8 → 0,64, et sa demi-vie vaut ln(0,5)/ln(0,8) ≈ 3,1 tokens. Le modèle apprend quand serrer ou ouvrir la porte. La vérification minimale consiste à contrôler les dimensions, le signe et l’ordre de grandeur. Si la variation obtenue contredit la prédiction, localiser la première opération qui change de sens au lieu de corriger seulement la dernière ligne.

</details>

### Barème Exercice 1 — /10

| Critère | Points |
|---|---:|
| Données et formes explicites | 2 |
| Calcul traçable | 3 |
| Prédiction avant variation | 2 |
| Interprétation et vérification | 2 |
| Limite nommée | 1 |

## Exercice 2 — Diagnostic d’une explication séduisante — Porte d’écriture

Un collègue affirme: « Porte d’écriture prouve que le système sera exact, rapide et stable dans tous les contextes. »

1. Séparez mécanisme, hypothèse, observation et conclusion.
2. Citez deux éléments corrects de la leçon et deux extrapolations non justifiées.
3. Proposez une expérience bornée avec variable contrôlée, métrique et seuil d’arrêt.
4. Réécrivez l’affirmation en une phrase défendable.

<details><summary>Solution argumentée</summary>

β_t dose la correction delta : S_t = S′ + β_t k eᵀ. Sur la trace, β = 0,5 n’applique que la moitié de l’erreur — il reste exactement (1−β)·e. β ≈ 0 ignore, β = 1 corrige à fond, décidé token par token. La stabilité tient à des détails contraignants : α borné dans [0,1] — pas seulement |α| ≤ 1, un α négatif ferait osciller le signe —, clés normalisées, et un ordre d’opérations déclaré : décroître, lire, corriger. Le parallèle avec Mamba est conceptuel. Il ne faut pas conclure que Gated DeltaNet et Mamba sont interchangeables.

L’affirmation mélange une relation locale et une garantie globale. Une version défendable décrit seulement le mécanisme observé, les conditions du test et la métrique relevée. Le test doit s’arrêter si les formes deviennent invalides, si la métrique se dégrade au-delà du seuil annoncé ou si une autre variable a changé.

</details>

### Barème Exercice 2 — /10

2 points par élément : séparation, ancrage dans la leçon, extrapolations, protocole, reformulation.

## Exercice 3 — Décision d’architecture et transfert — Capacité effective

Vous devez reproduire le cas guidé « Avec α=0,8, une trace de valeur 1 devient 0,8 puis 0,64 sans nouvelle écriture. Une correction β=0,5 n’ajoute ensuite que la moitié de l’erreur observée. » dans deux conditions. Option A utilise la chaîne complète jusqu’à « Capacité effective ». Option B est une référence transparente qui conserve « Pourquoi oublier », calcule directement la sortie attendue et n’utilise pas le mécanisme de compression ou d’ajustement étudié. Construisez une fiche de décision comportant:

- la charge et la contrainte dominante;
- le mécanisme de chaque option, sans slogan;
- une prédiction qualité, mémoire ou latence;
- un cas où votre procédure préférée perd;
- un protocole A/B, métriques et seuil de retour arrière;
- un verdict borné : choisir, différer ou refuser.

<details><summary>Éléments d’une bonne solution</summary>

La bonne grandeur est la durée utile : demi-vie ≈ 69 tokens à α = 0,99, ≈ 3,1 à α = 0,80, 1,0 à α = 0,5. La capacité effective combine taille de S, oubli et séparation des clés — pas la longueur maximale affichée du contexte. Le recouvrement est réel : récurrence plus contrôles appris. La différence aussi : la mémoire delta LIT son état (v̂ = S′ᵀk) et écrit l’erreur ; un SSM classique filtre le signal sans lecture associative. Même famille de motivations, équations distinctes. Établis : règle delta, décroissance exponentielle et demi-vies calculées ici. Pédagogiques : les valeurs α, β et les matrices 2×2 de la trace. Rapportés : les choix de portes exacts des modèles nommés.

Une bonne réponse ne présente pas le mécanisme récent comme gagnant par défaut. Elle conserve une référence mesurable, fixe le seuil avant le test et distingue le coût du composant du comportement du système complet. Le verdict doit citer ce qui reste incertain et la prochaine preuve qui pourrait le modifier.

</details>

### Barème Exercice 3 — /15

| Critère | Points |
|---|---:|
| Cadrage et référence | 3 |
| Chaînes causales comparées | 4 |
| Protocole et métriques | 4 |
| Seuil de retour arrière | 2 |
| Verdict borné | 2 |

## Prolongement

Refaites l’exercice 3 en inversant la contrainte dominante. Si vous aviez optimisé la mémoire, imposez maintenant une qualité minimale stricte; si vous aviez optimisé la fidélité, imposez une enveloppe mémoire divisée par deux. Identifiez le premier point du verdict qui change et la preuve nécessaire.

## Relecture avant remise

Relisez votre paquet comme si un autre groupe devait reproduire votre travail sans vous parler. Toutes les valeurs ou hypothèses de départ sont-elles présentes ? Les formes ou rôles sont-ils écrits avant les opérations ? La prédiction précède-t-elle réellement l’observation ? Le résultat est-il traduit en comportement plutôt que laissé comme nombre isolé ? Avez-vous testé une valeur limite et identifié une condition d’arrêt ? Le choix de procédure ou d’architecture conserve-t-il une référence mesurable et un seuil de retour arrière fixé avant le test ? Enfin, surlignez une phrase qui décrit ce qui est établi, une phrase qui reste une hypothèse et une mesure susceptible de changer votre verdict. Si l’un de ces éléments manque, le travail n’est pas reproductible.

## Annexe de référence pour la correction

## Chapitre 11 — Oubli : Gated DeltaNet et lien avec Mamba

### 11.1 Pourquoi l’oubli est utile

But : empêcher les anciennes informations d’occuper la mémoire pour toujours. Une porte est un nombre appris, souvent compris entre 0 et 1, qui contrôle la quantité d’information transmise.

Un tableau blanc est utile parce qu’on peut effacer partiellement les notes dépassées avant d’en écrire de nouvelles.

**Étape par étape**

- Appliquer une décroissance générale : S ← αS, où α proche de 1 signifie se souvenir et α proche de 0 oublier fortement.

- Appliquer la correction delta ciblée pour la clé actuelle.

- Utiliser β pour contrôler la force d’écriture.

**Exemple détaillé :** si S contient 10 et α=0,8, la décroissance laisse 8 avant la nouvelle écriture. Une décroissance répétée de 0,8 donne 10, 8, 6,4, 5,12… L’influence ancienne diminue progressivement.

**Pourquoi c’est important :** L’oubli est une gestion sélective des ressources. Il peut améliorer la capacité effective lorsque les anciens détails ne sont plus utiles.

**Vérification rapide :** α=1 efface-t-il la mémoire ? Réponse : non ; il conserve l’ancien état avant la nouvelle écriture.

### 11.2 Lien avec Mamba

But : situer la mémoire récurrente à portes dans une famille plus large. Mamba est un modèle d’espace d’état sélectif : il transporte un état de taille fixe dans le temps et laisse des contrôles dépendant de l’entrée décider quoi conserver et quoi injecter.

Les deux systèmes ressemblent à une expérience scientifique continue : conserver un état, le faire décroître ou le transformer, ajouter de nouvelles preuves et produire une sortie.

**Étape par étape**

- Thème commun : état récurrent de taille fixe.

- Thème commun : portes apprises dépendant de l’entrée.

- Différence importante : la mémoire de type Delta utilise explicitement des associations clé-valeur et des corrections ; Mamba est généralement formulé avec des équations d’espace d’état.

**Exemple détaillé :** Le lien est conceptuel ; il ne signifie pas que les deux architectures sont identiques.

**Pourquoi c’est important :** Reconnaître les familles aide à comparer les choix de conception sans confondre des mécanismes distincts.

**Vérification rapide :** quelle est l’idée centrale commune ? Réponse : un état appris de taille fixe, mis à jour à mesure que la séquence avance.

## Sources et frontière de preuve

- Dossier de cours bilingue fourni par le propriétaire, chapitre 11.
- Yang, Kautz & Hatamizadeh, “Gated Delta Networks: Improving Mamba2 with Delta Rule”, ICLR (2025), arXiv:2412.06464.
- Gu & Dao, “Mamba: Linear-Time Sequence Modeling with Selective State Spaces”, arXiv:2312.00752 (2023).
- Dossier source fourni par le propriétaire; les détails sur des produits nommés restent attribués à cette source jusqu’à vérification primaire.

> **Portée:** Établis : règle delta, décroissance exponentielle et demi-vies calculées ici. Pédagogiques : les valeurs α, β et les matrices 2×2 de la trace. Rapportés : les choix de portes exacts des modèles nommés. Ces références soutiennent le cadre de la session; elles ne transforment pas un choix de produit rapporté en résultat indépendant.
