1. Objectif causal
Le modèle maximise la vraisemblance du prochain token à chaque position autorisée par le masque causal. La perte moyenne agrège les positions et les exemples valides.
L = −Σ log p(x_t | x_<t)
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
2. Entropie croisée depuis les logits
La log-softmax stabilisée soustrait le log-sum-exp. La perte choisit ensuite le log-probabilité de la cible. Des logits plus grands ne sont utiles que relativement aux autres.
CE(z,y)=−z_y+log Σ exp(z_j)
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
3. Rétropropagation
La règle de chaîne calcule comment chaque paramètre a contribué à la perte. Les activations sauvegardées coûtent de la mémoire ; le checkpointing d’activations échange du recalcul contre de la mémoire.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
4. Optimiseur
AdamW combine moments des gradients, taux d’apprentissage et décroissance des poids. Le clipping peut borner des gradients extrêmes, mais ne répare pas une donnée ou une architecture défectueuse.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
5. Précision et parallélisme
BF16 réduit la mémoire des tenseurs sans représenter tous les états en pleine précision. Le parallélisme de données réplique les poids ; tensor/pipeline parallel répartissent d’autres dimensions avec communication.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
6. Checkpoint complet
Une reprise exacte exige poids, état de l’optimiseur, scheduler, scaler éventuel, position dans les données et états aléatoires. Un fichier de poids seul n’est pas un checkpoint d’entraînement complet.
Vérification de compréhension
Nommez l’entrée, l’état transformé, la sortie et une hypothèse nécessaire. Comparez ensuite votre chaîne à l’explication ci-dessus.
Cas guidé complet
Pour logits [2,1,0] et cible 0, softmax ≈ [0,665;0,245;0,090], donc CE ≈ 0,408. Le laboratoire modifie taux, gradient et poids, puis montre les champs nécessaires à une reprise.
Méthode de lecture: écrire les données, annoncer la forme de chaque objet, effectuer une seule transformation, puis interpréter le résultat avant de continuer.