advanced · Session 11

Systèmes de pré-formation et optimisation

Relier objectif causal, entropie croisée, rétropropagation, optimiseur, précision mixte, parallélisme et checkpoints.

120 min6 mécanismeslaboratoire causal

Ce que vous saurez faire

Ouvrir le laboratoire

Méthode de travail

Travaillez cette session comme une enquête causale. Avant chaque formule ou interaction, écrivez ce que vous pensez voir changer et ce qui doit rester fixe. Pendant le calcul, conservez les unités, les formes et les valeurs intermédiaires : elles permettent de localiser une erreur sans recommencer au hasard. Après le résultat, traduisez le nombre ou l’état en une phrase sur le comportement du système. Terminez toujours par un contre-exemple ou une valeur limite. Cette discipline sépare la compréhension d’un mécanisme de la simple reconnaissance de son vocabulaire et rend le laboratoire reproductible par un autre apprenant.

Construire le mécanisme pas à pas

1. Objectif causal

Le modèle maximise la vraisemblance du prochain token à chaque position autorisée par le masque causal. La perte moyenne agrège les positions et les exemples valides.

L = −Σ log p(x_t | x_<t)

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

2. Entropie croisée depuis les logits

La log-softmax stabilisée soustrait le log-sum-exp. La perte choisit ensuite le log-probabilité de la cible. Des logits plus grands ne sont utiles que relativement aux autres.

CE(z,y)=−z_y+log Σ exp(z_j)

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

3. Rétropropagation

La règle de chaîne calcule comment chaque paramètre a contribué à la perte. Les activations sauvegardées coûtent de la mémoire ; le checkpointing d’activations échange du recalcul contre de la mémoire.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

4. Optimiseur

AdamW combine moments des gradients, taux d’apprentissage et décroissance des poids. Le clipping peut borner des gradients extrêmes, mais ne répare pas une donnée ou une architecture défectueuse.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

5. Précision et parallélisme

BF16 réduit la mémoire des tenseurs sans représenter tous les états en pleine précision. Le parallélisme de données réplique les poids ; tensor/pipeline parallel répartissent d’autres dimensions avec communication.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

6. Checkpoint complet

Une reprise exacte exige poids, état de l’optimiseur, scheduler, scaler éventuel, position dans les données et états aléatoires. Un fichier de poids seul n’est pas un checkpoint d’entraînement complet.

Vérification de compréhension

Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.

Cas guidé complet

Pour logits [2,1,0] et cible 0, softmax ≈ [0,665;0,245;0,090], donc CE ≈ 0,408. Le laboratoire modifie taux, gradient et poids, puis montre les champs nécessaires à une reprise.

Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.

Frontière de validité

Les performances distribuées dépendent du matériel, du réseau, de la taille du modèle et de l’implémentation ; aucune estimation du laboratoire n’est un benchmark.

Statut de preuve: Mécanismes établis ; les simplifications numériques sont pédagogiques.

Vérifications rapides

1. Que fait réellement Objectif causal?

Le modèle maximise la vraisemblance du prochain token à chaque position autorisée par le masque causal. La perte moyenne agrège les positions et les exemples valides.

2. Que fait réellement Entropie croisée depuis les logits?

La log-softmax stabilisée soustrait le log-sum-exp. La perte choisit ensuite le log-probabilité de la cible. Des logits plus grands ne sont utiles que relativement aux autres.

3. Que fait réellement Rétropropagation?

La règle de chaîne calcule comment chaque paramètre a contribué à la perte. Les activations sauvegardées coûtent de la mémoire ; le checkpointing d’activations échange du recalcul contre de la mémoire.

4. Que fait réellement Optimiseur?

AdamW combine moments des gradients, taux d’apprentissage et décroissance des poids. Le clipping peut borner des gradients extrêmes, mais ne répare pas une donnée ou une architecture défectueuse.

Sources et frontière de preuve

Portée: Mécanismes établis ; les simplifications numériques sont pédagogiques.