Session systèmes 2/3 · Cours apprenant

CPU, GPU et quantification

Le choix matériel dépend de la forme de la charge. La quantification peut réduire la mémoire des poids, mais compatibilité, latence et qualité doivent être mesurées.

Rôles CPU et GPU

Le CPU convient au contrôle, au prétraitement et aux charges modestes. Le GPU offre beaucoup d’unités parallèles et une forte bande passante pour les tenseurs. Le prefill est parallèle ; le décodage reste séquentiel entre positions.

Estimation mémoire

Une première estimation des poids vaut paramètres × bits par poids ÷ 8. Elle exclut cache KV, activations, surcoût de l’allocateur, buffers et parfois des couches non quantifiées.

Porte de sortie quantifiée

Comparer au modèle de référence sur des tâches représentatives. Relever qualité, TTFT, latence inter-token, débit, pic mémoire, matériel, runtime et hash de l’artefact.

Ouvrir l’outil interactif Ouvrir l’outil interactif

Vérification rapide

Un fichier plus petit garantit-il une latence plus basse ?

Afficher la réponse

Non. Kernels, déquantification, charge et matériel peuvent inverser le résultat.

Quantifier les poids réduit-il automatiquement le cache KV ?

Afficher la réponse

Non. La précision des poids et celle du cache sont deux choix distincts.