Exercices corrigés — La chaîne complète de pré-formation
Consigne générale: chaque réponse doit montrer les données, la transformation, le résultat, une vérification et une limite. Un nombre seul ou une définition recopiée ne suffit pas.
Données de départ: La phrase « Maya lit un livre » devient cinq tokens. Le lot utilise les quatre premiers comme entrées et les quatre derniers comme cibles. Si le modèle donne 0,25 à la bonne cible, la perte de cette position vaut −log(0,25) ≈ 1,386.
Frontière à conserver: Un pipeline pédagogique omet le stockage distribué, la sécurité, les politiques de données et de nombreux contrôles de qualité indispensables en production.
Exercice 1 — Trace calculée — Collecter sans tout accepter
Reproduisez puis commentez la chaîne targets = tokens shifted left by one. Ajoutez un sixième token à la séquence de cinq tokens. Tracez les paires entrée→cible avant et après, puis indiquez ce qui change dans le lot sans prétendre que ce seul exemple améliore le modèle.
Livrable: un tableau données → opération → résultat → interprétation, plus deux phrases sur la valeur modifiée.
Solution guidée
La phrase « Maya lit un livre » devient cinq tokens. Le lot utilise les quatre premiers comme entrées et les quatre derniers comme cibles. Si le modèle donne 0,25 à la bonne cible, la perte de cette position vaut −log(0,25) ≈ 1,386.
Variante résolue: Cinq tokens produisent quatre paires de prochain token; six tokens en produisent cinq. Le lot gagne une position supervisée et une étape de calcul, mais la qualité dépend encore du filtrage, de la diversité et de nombreuses mises à jour.
Le filtrage est une étape de conception en tête de chaîne : déduplication par empreintes, détection de secrets, règles de licence et de provenance. L’article répété 3 000 fois ne doit compter qu’une fois — avant qu’un seul gradient ne soit dépensé dessus. Le tokenizer apprend un vocabulaire de sous-mots. « Maya lit un livre » devient 5 tokens pour 4 mots : [Maya][ lit][ un][ liv][re] — « livre » est coupé en deux, les frontières ne suivent pas les mots. La vérification minimale consiste à contrôler les dimensions, le signe et l’ordre de grandeur. Si la variation obtenue contredit la prédiction, localiser la première opération qui change de sens au lieu de corriger seulement la dernière ligne.
Barème Exercice 1 — /10
| Critère | Points |
|---|---|
| Données et formes explicites | 2 |
| Calcul traçable | 3 |
| Prédiction avant variation | 2 |
| Interprétation et vérification | 2 |
| Limite nommée | 1 |
Exercice 2 — Diagnostic d’une explication séduisante — Construire entrées et cibles
Un collègue affirme: « Construire entrées et cibles prouve que le système sera exact, rapide et stable dans tous les contextes. »
- Séparez mécanisme, hypothèse, observation et conclusion.
- Citez deux éléments corrects de la leçon et deux extrapolations non justifiées.
- Proposez une expérience bornée avec variable contrôlée, métrique et seuil d’arrêt.
- Réécrivez l’affirmation en une phrase défendable.
Solution argumentée
Le décalage d’un token fabrique la supervision gratuitement : pour [A,B,C,D], entrée [A,B,C], cible [B,C,D]. Chaque position prédit le token suivant sans voir le futur ; une séquence de L tokens fournit L−1 positions d’entraînement. On aligne sur la plus longue : T = 9 ; la courte reçoit 5 positions de padding et un masque marque le vide. La perte moyenne se divise par les 13 positions réelles, jamais par les 18 cases du rectangle. Un pipeline pédagogique omet le stockage distribué, la sécurité, les politiques de données et de nombreux contrôles de qualité indispensables en production.
L’affirmation mélange une relation locale et une garantie globale. Une version défendable décrit seulement le mécanisme observé, les conditions du test et la métrique relevée. Le test doit s’arrêter si les formes deviennent invalides, si la métrique se dégrade au-delà du seuil annoncé ou si une autre variable a changé.
Barème Exercice 2 — /10
2 points par élément : séparation, ancrage dans la leçon, extrapolations, protocole, reformulation.
Exercice 3 — Test de transfert entre deux procédures — Perte et mise à jour
Vous devez reproduire le cas guidé « La phrase « Maya lit un livre » devient cinq tokens. Le lot utilise les quatre premiers comme entrées et les quatre derniers comme cibles. Si le modèle donne 0,25 à la bonne cible, la perte de cette position vaut −log(0,25) ≈ 1,386. » dans deux conditions. Option A utilise la chaîne complète jusqu’à « Perte et mise à jour ». Option B est une référence transparente qui conserve « Collecter sans tout accepter », calcule directement la sortie attendue et n’utilise pas le mécanisme de compression ou d’ajustement étudié. Construisez une fiche de décision comportant:
- les valeurs de départ, la valeur modifiée et le résultat attendu;
- le mécanisme de chaque option, sans slogan;
- une prédiction sur l’erreur, le résultat ou le nombre d’étapes avant l’exécution;
- un cas où votre procédure préférée perd;
- un protocole A/B, métriques et seuil de retour arrière;
- un verdict borné : choisir, différer ou refuser.
Éléments d’une bonne solution
La softmax transforme les scores en probabilités, puis la perte prend −log p(cible) : p = 0,25 → 1,386 ; p = 0,50 → 0,693 ; p = 0,01 → 4,605. Les gradients redistribuent ensuite cette surprise sur tous les paramètres qui y ont contribué. La chaîne se termine en trois branches : le modèle de base ; l’instruction tuning et l’alignement, qui modifient le comportement ; et un jeu d’évaluation strictement séparé du corpus. Cette séparation se décide au filtrage, pas le jour du test. Mécanismes établis ; les simplifications numériques sont pédagogiques.
Une bonne réponse ne présente pas le mécanisme récent comme gagnant par défaut. Elle conserve une référence mesurable, fixe le seuil avant le test et distingue le coût du composant du comportement du système complet. Le verdict doit citer ce qui reste incertain et la prochaine preuve qui pourrait le modifier.
Barème Exercice 3 — /15
| Critère | Points |
|---|---|
| Cadrage et référence | 3 |
| Chaînes causales comparées | 4 |
| Protocole et métriques | 4 |
| Seuil de retour arrière | 2 |
| Verdict borné | 2 |
Prolongement
Refaites l’exercice 3 avec une nouvelle entrée et une nouvelle cible. Doublez ou divisez par deux la valeur ajustable, prédisez la direction du changement, puis dites à partir de quelle observation vous abandonneriez la procédure.
Relecture avant remise
Relisez votre paquet comme si un autre groupe devait reproduire votre travail sans vous parler. Toutes les valeurs ou hypothèses de départ sont-elles présentes ? Les formes ou rôles sont-ils écrits avant les opérations ? La prédiction précède-t-elle réellement l’observation ? Le résultat est-il traduit en comportement plutôt que laissé comme nombre isolé ? Avez-vous testé une valeur limite et identifié une condition d’arrêt ? Le choix de procédure ou d’architecture conserve-t-il une référence mesurable et un seuil de retour arrière fixé avant le test ? Enfin, surlignez une phrase qui décrit ce qui est établi, une phrase qui reste une hypothèse et une mesure susceptible de changer votre verdict. Si l’un de ces éléments manque, le travail n’est pas reproductible.
Annexe de référence pour la correction
1. Collecter sans tout accepter
Le filtrage est une étape de conception en tête de chaîne : déduplication par empreintes, détection de secrets, règles de licence et de provenance. L’article répété 3 000 fois ne doit compter qu’une fois — avant qu’un seul gradient ne soit dépensé dessus.
2. Tokeniser
Le tokenizer apprend un vocabulaire de sous-mots. « Maya lit un livre » devient 5 tokens pour 4 mots : [Maya][ lit][ un][ liv][re] — « livre » est coupé en deux, les frontières ne suivent pas les mots.
3. Construire entrées et cibles
Le décalage d’un token fabrique la supervision gratuitement : pour [A,B,C,D], entrée [A,B,C], cible [B,C,D]. Chaque position prédit le token suivant sans voir le futur ; une séquence de L tokens fournit L−1 positions d’entraînement.
Formule de travail:
targets = tokens shifted left by one
4. Former des lots
On aligne sur la plus longue : T = 9 ; la courte reçoit 5 positions de padding et un masque marque le vide. La perte moyenne se divise par les 13 positions réelles, jamais par les 18 cases du rectangle.
5. Perte et mise à jour
La softmax transforme les scores en probabilités, puis la perte prend −log p(cible) : p = 0,25 → 1,386 ; p = 0,50 → 0,693 ; p = 0,01 → 4,605. Les gradients redistribuent ensuite cette surprise sur tous les paramètres qui y ont contribué.
Formule de travail:
loss = −log p(target token)
6. Modèle de base et étapes suivantes
La chaîne se termine en trois branches : le modèle de base ; l’instruction tuning et l’alignement, qui modifient le comportement ; et un jeu d’évaluation strictement séparé du corpus. Cette séparation se décide au filtrage, pas le jour du test.
Sources et frontière de preuve
- Raffel et al., “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer” (T5/C4 corpus curation), JMLR (2020).
- Dossier source fourni par le propriétaire; les détails sur des produits nommés restent attribués à cette source jusqu’à vérification primaire.
Portée: Mécanismes établis ; les simplifications numériques sont pédagogiques. Ces références soutiennent le cadre de la session; elles ne transforment pas un choix de produit rapporté en résultat indépendant.