# Exercices corrigés — Synthèse : architecture hybride long contexte

**Consigne générale:** chaque réponse doit montrer les données, la transformation, le résultat, une vérification et une limite. Un nombre seul ou une définition recopiée ne suffit pas.

> **Données de départ:** Conception bornée : couches d’attention exacte périodiques pour récupération fidèle, couches delta entre elles pour état fixe, MLA pour réduire le cache par token, MoE pour capacité conditionnelle, checkpoints de profondeur espacés. Le verdict dépend de mesures qualité/latence/mémoire sur la tâche réelle.
>
> **Frontière à conserver:** Il n’existe pas de meilleur assemblage universel. Un schéma est une hypothèse ; seuls tests contrôlés, profils matériels et évaluations utilisateur établissent sa valeur.

## Exercice 1 — Trace causale — Avant l’inférence

Reproduisez puis commentez la chaîne `input → state → output`. Supprimez MLA du montage hybride et remplacez-le par un cache KV complet. Tracez le premier effet sur mémoire, fidélité de récupération et latence, sans supposer un gagnant universel.

**Livrable:** un tableau composant → information conservée → transformation → sortie, puis la trace avant/après suppression.

<details><summary>Solution guidée</summary>

Conception bornée : couches d’attention exacte périodiques pour récupération fidèle, couches delta entre elles pour état fixe, MLA pour réduire le cache par token, MoE pour capacité conditionnelle, checkpoints de profondeur espacés. Le verdict dépend de mesures qualité/latence/mémoire sur la tâche réelle.

**Variante résolue:** Le cache par token augmente parce que clés et valeurs ne sont plus comprimées. La récupération peut conserver davantage de détail, mais le trafic mémoire et la capacité nécessaire augmentent. Le verdict dépend de mesures qualité/latence/mémoire sur la charge réelle.

Le tri : la pré-formation apprend puis FIGE embeddings, projections, routeurs et portes. À l’inférence, ces paramètres s’appliquent ; seuls évoluent le contexte, le cache MLA, l’état delta S et les checkpoints — l’état de travail, remis à zéro à la requête suivante. Ce support est le flux résiduel : le texte devient tokens puis embeddings, et un vecteur de d_model = 4096 par position traverse les 48 blocs, chacun AJOUTANT sa contribution (session 20). Le flux est le bus de données de toute l’architecture. La vérification minimale contrôle que chaque flèche transporte une information nommée et que la sortie annoncée dépend réellement du composant supprimé. Si la prédiction échoue, localiser la première dépendance manquante.

</details>

### Barème Exercice 1 — /10

| Critère | Points |
|---|---:|
| Composants, rôles et hypothèses explicites | 2 |
| Chaîne causale traçable | 3 |
| Prédiction avant suppression | 2 |
| Interprétation et vérification | 2 |
| Limite nommée | 1 |

## Exercice 2 — Diagnostic d’une explication séduisante — Mélange séquentiel

Un collègue affirme: « Mélange séquentiel prouve que le système sera exact, rapide et stable dans tous les contextes. »

1. Séparez mécanisme, hypothèse, observation et conclusion.
2. Citez deux éléments corrects de la leçon et deux extrapolations non justifiées.
3. Proposez une expérience bornée avec variable contrôlée, métrique et seuil d’arrêt.
4. Réécrivez l’affirmation en une phrase défendable.

<details><summary>Solution argumentée</summary>

Le motif hybride : trois couches delta (état fixe, longueur quasi gratuite) puis une couche exacte sous MLA (rappel fidèle, cache réduit). Résultat de la trace : 1,5 Gio de cache et 1,1 Mio d’état — ÷16 sur le poste dominant. Chaque bloc route ses tokens : top-2 parmi 64 experts plus un partagé — 26 Md de paramètres résidents, 1,2 Md actifs par token. Dans le budget global, le MoE n’apparaît pas dans la mémoire de contexte : il vit dans le budget poids et dans la latence all-to-all. Il n’existe pas de meilleur assemblage universel. Un schéma est une hypothèse ; seuls tests contrôlés, profils matériels et évaluations utilisateur établissent sa valeur.

L’affirmation mélange une relation locale et une garantie globale. Une version défendable décrit seulement le mécanisme observé, les conditions du test et la métrique relevée. Le test doit s’arrêter si les formes deviennent invalides, si la métrique se dégrade au-delà du seuil annoncé ou si une autre variable a changé.

</details>

### Barème Exercice 2 — /10

2 points par élément : séparation, ancrage dans la leçon, extrapolations, protocole, reformulation.

## Exercice 3 — Décision d’architecture et transfert — Profondeur et sortie

Comparez deux architectures pour le même service long contexte. Option A est le montage hybride du cas guidé : attention exacte périodique, mémoire delta entre les couches, MLA, MoE et points de récupération en profondeur. Option B est une référence dense : attention exacte et FFN dense à chaque couche, cache KV non comprimé, sans routage ni récupération en profondeur. Construisez une fiche de décision comportant:

- la charge et la contrainte dominante;
- le mécanisme de chaque option, sans slogan;
- une prédiction qualité, mémoire ou latence;
- un cas où votre procédure préférée perd;
- un protocole A/B, métriques et seuil de retour arrière;
- un verdict borné : choisir, différer ou refuser.

<details><summary>Éléments d’une bonne solution</summary>

Des checkpoints espacés — x₀, x₁₂, x₂₄, x₃₆ : quatre ici, l’espacement de 12 de la session 20 prolongé sur 48 couches — qu’un mélange softmax resélectionne, puis norme → W_vocab → softmax du token suivant. Préfill : des chunks parallèles (session 15) remplissent caches et états — régime limité par le calcul. Décodage : un token relit tout le passé disponible, met à jour S et le cache — régime limité par la bande passante mémoire. Deux profils, un seul code. Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source.

Une bonne réponse ne présente pas le mécanisme récent comme gagnant par défaut. Elle conserve une référence mesurable, fixe le seuil avant le test et distingue le coût du composant du comportement du système complet. Le verdict doit citer ce qui reste incertain et la prochaine preuve qui pourrait le modifier.

</details>

### Barème Exercice 3 — /15

| Critère | Points |
|---|---:|
| Cadrage et référence | 3 |
| Chaînes causales comparées | 4 |
| Protocole et métriques | 4 |
| Seuil de retour arrière | 2 |
| Verdict borné | 2 |

## Prolongement

Refaites l’exercice 3 en inversant la contrainte dominante. Si vous aviez optimisé la mémoire, imposez maintenant une qualité minimale stricte; si vous aviez optimisé la fidélité, imposez une enveloppe mémoire divisée par deux. Identifiez le premier point du verdict qui change et la preuve nécessaire.

## Relecture avant remise

Relisez votre paquet comme si un autre groupe devait reproduire votre travail sans vous parler. Toutes les valeurs ou hypothèses de départ sont-elles présentes ? Les formes ou rôles sont-ils écrits avant les opérations ? La prédiction précède-t-elle réellement l’observation ? Le résultat est-il traduit en comportement plutôt que laissé comme nombre isolé ? Avez-vous testé une valeur limite et identifié une condition d’arrêt ? Le choix de procédure ou d’architecture conserve-t-il une référence mesurable et un seuil de retour arrière fixé avant le test ? Enfin, surlignez une phrase qui décrit ce qui est établi, une phrase qui reste une hypothèse et une mesure susceptible de changer votre verdict. Si l’un de ces éléments manque, le travail n’est pas reproductible.

## Annexe de référence pour la correction

## Chapitre 16 — Assembler un système de type Kimi K3

### 16.1 Le réseau principal comme une équipe

But : combiner les éléments sans prétendre qu’ils remplissent tous le même rôle. Le récit architectural fourni décrit un système hybride utilisant des représentations de jetons, des mécanismes de mélange séquentiel, du calcul feed-forward ou expert, des chemins résiduels, de la normalisation et une tête de sortie.

Imagine une rédaction : les archives mémorisent, les journalistes récupèrent le contexte, les spécialistes analysent, les éditeurs combinent les brouillons et l’éditeur choisit le prochain mot.

**Étape par étape**

- Tokeniseur : convertit le texte en identifiants de jetons.

- Plongement : convertit les identifiants en vecteurs.

- KDA ou autre mélangeur de séquence : apporte l’information des jetons précédents dans la représentation actuelle.

- Composants MLA ou d’attention exacte, s’ils sont présents : conservent un accès plus spécifique à certains jetons.

- Composant MoE/feed-forward : transforme chaque jeton par des spécialistes sélectionnés.

- Chemins résiduels et normalisation : stabilisent et combinent les mises à jour.

- Projection de sortie : crée un logit par jeton du vocabulaire ; softmax transforme les logits en probabilités.

**Exemple détaillé :** Aucun composant isolé n’est « l’intelligence ». Les capacités émergent des interactions entraînées entre représentations, mémoire, routage, transformations non linéaires, données et objectif.

**Pourquoi c’est important :** La leçon architecturale est la division du travail sous contraintes matérielles.

**Vérification rapide :** quel composant convertit les vecteurs cachés finaux en scores de vocabulaire ? Réponse : la projection de sortie, ou tête du modèle de langage.

### 16.2 Le trajet d’un jeton pendant le préremplissage

But : suivre un prompt dans le modèle. Le préremplissage désigne le traitement des jetons du prompt avant de générer le premier nouveau jeton.

C’est comme lire toutes les pages fournies avec un examen avant d’écrire la première réponse.

**Étape par étape**

- Tokeniser le prompt et rechercher les plongements.

- Traiter de nombreuses positions du prompt en parallèle lorsque la causalité le permet.

- Dans les couches récurrentes par blocs, utiliser de grandes opérations matricielles dans chaque bloc et transmettre l’état entre blocs.

- Dans les couches d’attention avec cache, construire des entrées de cache comprimées ou complètes par jeton.

- Router les représentations vers les experts sélectionnés.

- Produire des logits à chaque position pendant l’entraînement, ou à la dernière position du prompt pendant l’inférence.

**Exemple détaillé :** Exemple : pour 256 jetons de prompt et des blocs de 64, il existe quatre blocs récurrents. Le matériel peut traiter une grande partie de chaque bloc comme des lots matriciels, au lieu de 256 petites boucles isolées.

**Pourquoi c’est important :** Les performances du préremplissage dépendent souvent fortement du calcul parallèle et de la bande passante mémoire.

**Vérification rapide :** le préremplissage génère-t-il toute la réponse en une fois ? Réponse : non. Il prépare les états et caches ; le décodage génère ensuite les nouveaux jetons de façon autorégressive.

### 16.3 Le trajet d’un jeton pendant le décodage

But : suivre un nouveau jeton généré. Le décodage consiste à générer les jetons un par un après le préremplissage.

Écris un mot, relis les notes nécessaires, puis choisis le mot suivant.

**Étape par étape**

- Plonger le jeton le plus récent.

- Dans chaque couche récurrente, lire l’état fixe, calculer la sortie de couche et mettre l’état à jour.

- Dans chaque couche d’attention avec cache, comparer la requête actuelle aux enregistrements de jetons en cache.

- Exécuter les experts routés et les chemins résiduels/de profondeur.

- Projeter vers les logits, obtenir une distribution de probabilités et sélectionner le prochain jeton.

- Ajouter le jeton et répéter jusqu’à une condition d’arrêt.

**Exemple détaillé :** Un état récurrent fixe garde une forme constante par couche pendant le décodage. Un cache par jeton grandit à mesure que de nouveaux jetons sont générés. Un modèle hybride hérite des deux comportements dans les couches concernées.

**Pourquoi c’est important :** La vitesse de décodage dépend des paramètres actifs, du trafic de cache/état, de la communication du routage, des noyaux et du matériel — pas seulement du nombre théorique d’opérations.

**Vérification rapide :** pourquoi la génération est-elle dite autorégressive ? Réponse : chaque jeton nouvellement choisi devient une partie de l’entrée utilisée pour choisir le suivant.

### 16.4 Modèle mental final

But : condenser tout le cours en une chaîne : texte → jetons → vecteurs → couches → mélange mémoire/contexte → spécialistes → logits → prochain jeton.

Le modèle est une très grande machine numérique apprise. Il ne stocke pas les phrases sous forme de petits fichiers ; il transforme des vecteurs au moyen de matrices apprises et d’états temporaires.

**Étape par étape**

- L’attention exacte interroge des enregistrements passés individuels.

- La mémoire linéaire/de type KDA interroge un état courant comprimé et corrigible.

- MLA comprime les enregistrements par jeton.

- MoE active des spécialistes sélectionnés.

- Les chemins de type AttnRes peuvent récupérer des représentations utiles de profondeurs antérieures.

- La tête de sortie prédit le prochain jeton.

**Exemple détaillé :** La meilleure conception n’est pas celle qui porte le nom le plus impressionnant. C’est celle qui atteint la qualité, la latence, l’usage mémoire, la stabilité d’entraînement et le coût requis sur du matériel réel.

**Pourquoi c’est important :** Tu possèdes maintenant assez de bases pour lire les schémas architecturaux avec esprit critique : définir chaque objet, vérifier les formes, suivre le flux d’information et indiquer la solidité des preuves.

**Vérification rapide :** quelles quatre questions poser face à un nouveau mécanisme ? Réponse : quel problème résout-il ? Quelle information stocke-t-il ou transforme-t-il ? Quelles sont les formes des tenseurs ? Quelles preuves soutiennent l’avantage annoncé ?

## Sources et frontière de preuve

- Dossier de cours bilingue fourni par le propriétaire, chapitre 16.
- Vaswani et al., “Attention Is All You Need”, NeurIPS (2017).
- DeepSeek-AI, “DeepSeek-V2” (Multi-head Latent Attention), arXiv:2405.04434 (2024).
- Yang, Kautz & Hatamizadeh, “Gated Delta Networks: Improving Mamba2 with Delta Rule”, ICLR (2025).
- Dossier source fourni par le propriétaire; les détails sur des produits nommés restent attribués à cette source jusqu’à vérification primaire.

> **Portée:** Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source. Ces références soutiennent le cadre de la session; elles ne transforment pas un choix de produit rapporté en résultat indépendant.
