Le cache clé-valeur conserve l’état d’attention des tokens déjà traités. Il accélère le décodage mais croît avec le contexte et les séquences concurrentes.
Modèle de taille
Une estimation courante vaut 2 × couches × têtes KV × dimension de tête × tokens en cache × octets par élément. Multiplier par les séquences actives lorsque les caches sont indépendants.
Leviers d’optimisation
Borner le contexte, regrouper les requêtes, utiliser GQA/MQA si le modèle le permet, paginer les blocs, réutiliser les préfixes vérifiés et évaluer séparément une précision de cache réduite.
Mesurer le service
Suivre TTFT, latence inter-token, débit, occupation du cache, évictions/recalculs et latences p50/p95 avec des contextes et une concurrence réalistes.
Vérification rapide
Que devient la mémoire KV si le contexte actif double ?
Afficher la réponse
Dans l’estimation linéaire simplifiée, elle double approximativement.
Le prompt caching fournisseur est-il identique au cache KV actif ?
Afficher la réponse
Non. La réutilisation de préfixe suit des règles propres au fournisseur.