Le cache clé-valeur conserve l’état d’attention des tokens déjà traités. Il accélère le décodage mais croît avec le contexte et les séquences concurrentes.
Modèle de taille
Une estimation courante vaut 2 × couches × têtes KV × dimension de tête × tokens en cache × octets par élément. Multiplier par les séquences actives lorsque les caches sont indépendants.
Leviers d’optimisation
Borner le contexte, regrouper les requêtes, utiliser GQA/MQA si le modèle le permet, paginer les blocs, réutiliser les préfixes vérifiés et évaluer séparément une précision de cache réduite.
Mesurer le service
Suivre TTFT, latence inter-token, débit, occupation du cache, évictions/recalculs et latences p50/p95 avec des contextes et une concurrence réalistes.
Limite de l’estimation
Énoncer les hypothèses d’architecture puis comparer avec la télémétrie du runtime, y compris fragmentation et surcoût.