Applied AI · advanced · Session 21
Guide du professeur — Synthèse : architecture hybride long contexte
← Retour au programmeEnglishSource .md

Guide du professeur — Synthèse : architecture hybride long contexte

Durée: 120 minutes
Positionnement: Assembler entraînement, Q/K/V, mémoires, caches, experts et chemins résiduels en un préfill puis un décodage complets.
Preuve attendue: Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source.

Résultats observables et préparation

Avant la séance, le formateur exécute lui-même le cas guidé et le laboratoire, imprime le paquet d’exercices, prépare un tableau à quatre colonnes — hypothèse, prédiction, observation, écart — et vérifie que chaque notation mathématique est accompagnée de ses dimensions. La démonstration ne doit pas devenir une lecture de slides.

Diagnostic

  1. Expliquez en une phrase: Avant l’inférence. Quelle observation rendrait votre explication fausse ?
  2. Expliquez en une phrase: Entrée et représentation. Quelle observation rendrait votre explication fausse ?
  3. Expliquez en une phrase: Mélange séquentiel. Quelle observation rendrait votre explication fausse ?

Décision pédagogique: si deux réponses sur trois restent nominales ou sans condition de validité, reprendre le vocabulaire avec un exemple numérique avant toute formule. Une réponse fluide mais non falsifiable n’est pas considérée comme acquise.

Plan minuté

Temps Activité Preuve observable
0–10 min Diagnostic individuel, puis comparaison en binôme Trois réponses et une incertitude nommée
10–25 min Mise en situation et vocabulaire Schéma entrée → état → sortie annoté
25–55 min Développement du mécanisme au tableau Formes, hypothèses et calcul intermédiaire visibles
55–75 min Cas guidé, erreurs volontairement introduites Correction argumentée, pas seulement le bon nombre
75–95 min Laboratoire causal : prédire, modifier une variable, exécuter Tableau prédiction / observation / écart
95–112 min Exercices 1 et 2, correction croisée Production conservée et barème appliqué
112–120 min Ticket de sortie et transfert Mécanisme, frontière, prochaine expérience

Notes pédagogiques

Chapitre 16 — Assembler un système de type Kimi K3

16.1 Le réseau principal comme une équipe

But : combiner les éléments sans prétendre qu’ils remplissent tous le même rôle. Le récit architectural fourni décrit un système hybride utilisant des représentations de jetons, des mécanismes de mélange séquentiel, du calcul feed-forward ou expert, des chemins résiduels, de la normalisation et une tête de sortie.

Imagine une rédaction : les archives mémorisent, les journalistes récupèrent le contexte, les spécialistes analysent, les éditeurs combinent les brouillons et l’éditeur choisit le prochain mot.

Étape par étape

Exemple détaillé : Aucun composant isolé n’est « l’intelligence ». Les capacités émergent des interactions entraînées entre représentations, mémoire, routage, transformations non linéaires, données et objectif.

Pourquoi c’est important : La leçon architecturale est la division du travail sous contraintes matérielles.

Vérification rapide : quel composant convertit les vecteurs cachés finaux en scores de vocabulaire ? Réponse : la projection de sortie, ou tête du modèle de langage.

16.2 Le trajet d’un jeton pendant le préremplissage

But : suivre un prompt dans le modèle. Le préremplissage désigne le traitement des jetons du prompt avant de générer le premier nouveau jeton.

C’est comme lire toutes les pages fournies avec un examen avant d’écrire la première réponse.

Étape par étape

Exemple détaillé : Exemple : pour 256 jetons de prompt et des blocs de 64, il existe quatre blocs récurrents. Le matériel peut traiter une grande partie de chaque bloc comme des lots matriciels, au lieu de 256 petites boucles isolées.

Pourquoi c’est important : Les performances du préremplissage dépendent souvent fortement du calcul parallèle et de la bande passante mémoire.

Vérification rapide : le préremplissage génère-t-il toute la réponse en une fois ? Réponse : non. Il prépare les états et caches ; le décodage génère ensuite les nouveaux jetons de façon autorégressive.

16.3 Le trajet d’un jeton pendant le décodage

But : suivre un nouveau jeton généré. Le décodage consiste à générer les jetons un par un après le préremplissage.

Écris un mot, relis les notes nécessaires, puis choisis le mot suivant.

Étape par étape

Exemple détaillé : Un état récurrent fixe garde une forme constante par couche pendant le décodage. Un cache par jeton grandit à mesure que de nouveaux jetons sont générés. Un modèle hybride hérite des deux comportements dans les couches concernées.

Pourquoi c’est important : La vitesse de décodage dépend des paramètres actifs, du trafic de cache/état, de la communication du routage, des noyaux et du matériel — pas seulement du nombre théorique d’opérations.

Vérification rapide : pourquoi la génération est-elle dite autorégressive ? Réponse : chaque jeton nouvellement choisi devient une partie de l’entrée utilisée pour choisir le suivant.

16.4 Modèle mental final

But : condenser tout le cours en une chaîne : texte → jetons → vecteurs → couches → mélange mémoire/contexte → spécialistes → logits → prochain jeton.

Le modèle est une très grande machine numérique apprise. Il ne stocke pas les phrases sous forme de petits fichiers ; il transforme des vecteurs au moyen de matrices apprises et d’états temporaires.

Étape par étape

Exemple détaillé : La meilleure conception n’est pas celle qui porte le nom le plus impressionnant. C’est celle qui atteint la qualité, la latence, l’usage mémoire, la stabilité d’entraînement et le coût requis sur du matériel réel.

Pourquoi c’est important : Tu possèdes maintenant assez de bases pour lire les schémas architecturaux avec esprit critique : définir chaque objet, vérifier les formes, suivre le flux d’information et indiquer la solidité des preuves.

Vérification rapide : quelles quatre questions poser face à un nouveau mécanisme ? Réponse : quel problème résout-il ? Quelle information stocke-t-il ou transforme-t-il ? Quelles sont les formes des tenseurs ? Quelles preuves soutiennent l’avantage annoncé ?

Conduite du cas guidé

Conception bornée : couches d’attention exacte périodiques pour récupération fidèle, couches delta entre elles pour état fixe, MLA pour réduire le cache par token, MoE pour capacité conditionnelle, checkpoints de profondeur espacés. Le verdict dépend de mesures qualité/latence/mémoire sur la tâche réelle.

Ne révélez pas le résultat en une fois. Faites annoncer la prochaine opération, sa forme et le signe attendu. Après chaque ligne, demandez : « Qu’est-ce qui a changé ? Qu’est-ce qui est resté fixe ? Quelle hypothèse avons-nous utilisée ? » Une erreur de calcul corrigée avec une chaîne causale vaut davantage qu’un résultat deviné.

Protocole du laboratoire

  1. Écrire une prédiction qualitative et, si possible, numérique avant de toucher le contrôle.
  2. Modifier une seule variable; garder une capture ou relever les valeurs initiales et finales.
  3. Expliquer l’écart avec le mécanisme, pas avec « l’outil a fait cela ».
  4. Tester une valeur limite et dire où la maquette cesse de représenter un système réel.

Idées fausses

# Idée fausse observable Correction ancrée Relance
1 « Avant l’inférence suffit à garantir le résultat, sans hypothèse ni mesure. » Le tri : la pré-formation apprend puis FIGE embeddings, projections, routeurs et portes. À l’inférence, ces paramètres s’appliquent ; seuls évoluent le contexte, le cache MLA, l’état delta S et les checkpoints — l’état de travail, remis à zéro à la requête suivante. Demander un contre-exemple, puis faire reformuler le mécanisme avec sa condition de validité.
2 « Entrée et représentation suffit à garantir le résultat, sans hypothèse ni mesure. » Ce support est le flux résiduel : le texte devient tokens puis embeddings, et un vecteur de d_model = 4096 par position traverse les 48 blocs, chacun AJOUTANT sa contribution (session 20). Le flux est le bus de données de toute l’architecture. Demander un contre-exemple, puis faire reformuler le mécanisme avec sa condition de validité.
3 « Mélange séquentiel suffit à garantir le résultat, sans hypothèse ni mesure. » Le motif hybride : trois couches delta (état fixe, longueur quasi gratuite) puis une couche exacte sous MLA (rappel fidèle, cache réduit). Résultat de la trace : 1,5 Gio de cache et 1,1 Mio d’état — ÷16 sur le poste dominant. Demander un contre-exemple, puis faire reformuler le mécanisme avec sa condition de validité.

Frontière à maintenir: Il n’existe pas de meilleur assemblage universel. Un schéma est une hypothèse ; seuls tests contrôlés, profils matériels et évaluations utilisateur établissent sa valeur.

Questions de relance

  1. Si nous supprimons ou inversons Avant l’inférence, quelle sortie change en premier, et quelle observation le montrerait ?
  2. Si nous supprimons ou inversons Entrée et représentation, quelle sortie change en premier, et quelle observation le montrerait ?
  3. Si nous supprimons ou inversons Mélange séquentiel, quelle sortie change en premier, et quelle observation le montrerait ?
  4. Si nous supprimons ou inversons Experts, quelle sortie change en premier, et quelle observation le montrerait ?
  5. Si nous supprimons ou inversons Profondeur et sortie, quelle sortie change en premier, et quelle observation le montrerait ?
  6. Si nous supprimons ou inversons Préfill puis décodage, quelle sortie change en premier, et quelle observation le montrerait ?

Évaluation

Niveau Critère
0 Répète des termes sans relier entrée, transformation et sortie.
1 Décrit la chaîne mais ne vérifie ni forme ni hypothèse.
2 Exécute le cas, explique le résultat et nomme une limite.
3 Transfère sur un cas inédit, compare une alternative et propose une mesure qui pourrait invalider son choix.

Seuil de sortie : niveau 2 sur le cas guidé et au moins un exercice; une formule mémorisée sans interprétation reste niveau 1.

Protocole d’observation et de reprise

Pendant les échanges, le formateur relève des preuves et non des impressions. Une preuve de compréhension contient un objet nommé, une transformation justifiée et une conséquence vérifiable. Si un apprenant donne le bon résultat sans chaîne, demander de reconstruire la ligne précédente. S’il donne une chaîne cohérente avec un résultat faux, conserver la chaîne et isoler l’erreur de calcul. S’il emploie le vocabulaire d’un autre concept, faire comparer les deux mécanismes dans un tableau entrée, état, sortie, coût et limite. La reprise se fait sur la première rupture seulement : vocabulaire, formes, opération, interprétation ou portée de l’affirmation. Après correction, proposer un cas voisin avec une valeur différente; la réussite sur le même exemple ne prouve pas le transfert. Pour le travail en binôme, attribuer les rôles « opérateur » et « vérificateur », puis les inverser. Le vérificateur ne donne pas la réponse : il exige une hypothèse, contrôle la forme et demande quelle observation pourrait contredire le raisonnement. Le formateur conserve le ticket de sortie et classe la rupture dominante. La séance suivante commence par un problème de trois minutes ciblant cette rupture, plutôt que par une répétition générale du cours.

Différenciation

Suivi après la séance

Dans les vingt-quatre heures, renvoyer à chaque apprenant son ticket annoté avec une seule priorité, la ressource précise à rouvrir et un mini-cas différent du cas guidé. La reprise demande trois éléments : une prédiction écrite, une trace conservée et une phrase expliquant l’écart. Au cours suivant, échantillonner deux productions : une qui a réparé la rupture et une qui reste ambiguë. Les discuter sans nommer les auteurs, puis faire expliciter le critère qui distingue les deux. Ne pas utiliser le taux de complétion comme preuve de maîtrise. La preuve de reprise est une chaîne correcte sur un cas nouveau, accompagnée d’une limite. Si la même rupture apparaît chez plus d’un tiers du groupe, corriger le support ou la démonstration avant d’attribuer le problème aux apprenants.

Le suivi est clos seulement lorsque la nouvelle production montre la chaîne causale, la vérification et la frontière, et non lorsque le fichier a simplement été rendu.

Sources et frontière de preuve

Portée: Mixte : mécanismes établis + choix de type Kimi K3 rapportés par la source. Ces références soutiennent le cadre de la session; elles ne transforment pas un choix de produit rapporté en résultat indépendant.

Ticket de sortie

En six lignes maximum : mécanisme; calcul ou trace; observation; frontière; niveau de preuve; prochaine expérience. Le formateur annote une seule rupture causale prioritaire pour la reprise.