beginner · Session 11

Comment un modèle apprend à partir d’exemples

Suivre une boucle d’apprentissage complète sans calcul avancé : exemple, prédiction, erreur, petit ajustement, répétition.

120 min6 mécanismeslaboratoire causal

Ce que vous saurez faire

Ouvrir le laboratoire

Méthode de travail

Travaillez cette session comme une enquête causale. Avant chaque formule ou interaction, écrivez ce que vous pensez voir changer et ce qui doit rester fixe. Pendant le calcul, conservez les unités, les formes et les valeurs intermédiaires : elles permettent de localiser une erreur sans recommencer au hasard. Après le résultat, traduisez le nombre ou l’état en une phrase sur le comportement du système. Terminez toujours par un contre-exemple ou une valeur limite. Cette discipline sépare la compréhension d’un mécanisme de la simple reconnaissance de son vocabulaire et rend le laboratoire reproductible par un autre apprenant.

Construire le mécanisme pas à pas

1. Un exemple et une cible

Le problème : Vous voulez qu’un programme complète « le ciel est… ». Sans exemples, il faudrait écrire une règle par phrase possible : 10 000 phrases, 10 000 règles, et la 10 001ᵉ échoue quand même. Personne ne maintient un tel catalogue.

L’idée : Un exemple remplace la règle par un signal : une entrée et la réponse attendue. Pour « le ciel est… », la cible « bleu » n’explique rien — elle donne un point de comparaison. Notre maquette n’en garde que les nombres : entrée x = 2, cible y = 1.

Pourquoi / à quel prix : Cela marche parce qu’un signal de comparaison se collecte par millions, là où les règles se rédigent une à une. Le prix : la cible ne dit jamais pourquoi. Un exemple faux — « le ciel est… → vert » — serait appris avec la même docilité qu’un exemple juste.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

2. La prédiction

Le problème : Comment corriger un modèle qui ne sait encore rien ? « Il devine mal » n’est pas mesurable. Sans une sortie chiffrée à comparer à la cible, il n’existe ni écart calculable, ni direction de progrès : la boucle ne peut même pas démarrer.

L’idée : Le modèle applique son réglage actuel, quel qu’il soit : p = w × x. Avec w = 0,4 et x = 2, il propose p = 0,8. Ce 0,8 n’est ni bon ni mauvais en soi : c’est la matière première de la comparaison avec la cible 1.

Pourquoi / à quel prix : Pourquoi c’est suffisant : même une mauvaise prédiction chiffrée rend l’écart mesurable, donc corrigeable. Le prix : une prédiction n’engage à rien — 0,8 peut être presque juste pour un couple (x ; y) et absurde pour un autre. On ne juge jamais un modèle sur une seule sortie.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

3. Mesurer l’erreur

Le problème : « La prédiction est mauvaise » — mauvaise de combien, et dans quel sens ? Si vous ignorez si 0,8 est trop haut ou trop bas par rapport à 1, vous ne savez pas s’il faut augmenter ou diminuer w. Un jugement sans signe ne guide rien.

L’idée : L’erreur transforme le jugement en nombre signé : e = 1 − 0,8 = +0,20, donc prédire plus haut. Une prédiction de 1,3 donnerait e = −0,30 : prédire plus bas. Le signe donne la direction, la valeur donne l’ampleur du geste.

error = target − prediction

Pourquoi / à quel prix : Pourquoi ça marche : un nombre signé est exactement ce que la mise à jour peut consommer. Le prix : e ne mesure qu’un exemple. Un modèle peut être parfait sur (2 ; 1) et faux partout ailleurs — c’est une boussole locale, pas un certificat général.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

4. Ajuster un paramètre

Le problème : Vous savez qu’il faut prédire plus haut. De combien bouger w = 0,4 ? Sauter directement à la valeur parfaite sur-réagit à un exemple peut-être atypique ; ne rien bouger n’apprend rien. Il faut un pas dosé entre ces deux excès.

L’idée : La mise à jour dose le pas avec le taux d’apprentissage : w ← 0,4 + 0,1 × 0,20 = 0,42. La nouvelle prédiction 0,84 se rapproche de la cible 1 sans l’atteindre : chaque exemple tire un peu le réglage, aucun ne le dicte.

new weight = old weight + learning rate × error

Pourquoi / à quel prix : Le prix du dosage se lit dans la table des taux : à 0,001 le progrès est invisible, à 3 l’erreur explose de 0,20 à 5,00. Le taux n’est pas un détail d’implémentation : c’est le compromis vitesse/stabilité, et c’est un humain qui le choisit.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

5. Répéter sur beaucoup d’exemples

Le problème : Entraîné seulement sur (2 ; 1), le modèle converge vers w = 0,5 — parfait sur cet exemple. Arrive l’exemple B : x = 1, cible 0,7. Il voudrait w = 0,7. Aucun poids unique ne satisfait les deux : le spécialiste d’un exemple échoue sur le suivant.

L’idée : La pré-formation répète la boucle sur des millions d’exemples variés, servis par lots. Tiré tour à tour vers 0,5 et vers 0,7, w se stabilise vers un compromis (≈ 0,54) qui réduit l’erreur moyenne — aucun exemple n’est parfait, tous sont approchés.

Pourquoi / à quel prix : Ce compromis est précisément ce qui se généralise : il capture le motif commun, pas un cas isolé. Le prix : la moyenne penche du côté du nombre. Si 99 % des exemples disent une chose et 1 % une autre, le poids final ignore presque la minorité — la composition du corpus décide.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

6. Entraînement ≠ conversation

Le problème : Vous corrigez l’assistant dans le chat, sa réponse suivante s’améliore… puis une conversation neuve répète la même erreur. S’il « apprend », pourquoi a-t-il oublié ? Confondre les deux régimes fait attendre du chat ce que seul l’entraînement peut faire.

L’idée : Ce sont deux régimes distincts. Pendant l’entraînement, w change : 0,4 → 0,42. Pendant une conversation, w est figé ; seul le contenu de la fenêtre de contexte varie. Votre correction vit dans le contexte, pas dans les poids.

Pourquoi / à quel prix : Image utile : le contexte est un post-it, les poids sont la gravure. Le post-it disparaît avec la fenêtre ; regraver exige un ré-entraînement coûteux et contrôlé. Ce gel est un choix de conception — il protège le modèle de chaque conversation — pas une panne.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

Cas guidé complet

Avec poids 0,4, entrée 2 et cible 1 : prédiction 0,8, erreur 0,2. Avec un taux de 0,1, le poids augmente légèrement. Le laboratoire montre que la nouvelle prédiction se rapproche de 1.

Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.

Frontière de validité

Cette boucle à un poids est une maquette pédagogique. Les vrais modèles ont de très nombreux paramètres, des gradients et des optimisateurs.

Statut de preuve: Mécanismes établis ; les simplifications numériques sont pédagogiques.

Vérifications rapides

1. Que fait réellement Un exemple et une cible?

Un exemple remplace la règle par un signal : une entrée et la réponse attendue. Pour « le ciel est… », la cible « bleu » n’explique rien — elle donne un point de comparaison. Notre maquette n’en garde que les nombres : entrée x = 2, cible y = 1.

2. Que fait réellement La prédiction?

Le modèle applique son réglage actuel, quel qu’il soit : p = w × x. Avec w = 0,4 et x = 2, il propose p = 0,8. Ce 0,8 n’est ni bon ni mauvais en soi : c’est la matière première de la comparaison avec la cible 1.

3. Que fait réellement Mesurer l’erreur?

L’erreur transforme le jugement en nombre signé : e = 1 − 0,8 = +0,20, donc prédire plus haut. Une prédiction de 1,3 donnerait e = −0,30 : prédire plus bas. Le signe donne la direction, la valeur donne l’ampleur du geste.

4. Que fait réellement Ajuster un paramètre?

La mise à jour dose le pas avec le taux d’apprentissage : w ← 0,4 + 0,1 × 0,20 = 0,42. La nouvelle prédiction 0,84 se rapproche de la cible 1 sans l’atteindre : chaque exemple tire un peu le réglage, aucun ne le dicte.

Sources et frontière de preuve

Portée: Mécanismes établis ; les simplifications numériques sont pédagogiques.