Session systèmes 3/3 · Cours apprenant

Dimensionnement et optimisation du cache KV

Le cache clé-valeur conserve l’état d’attention des tokens déjà traités. Il accélère le décodage mais croît avec le contexte et les séquences concurrentes.

Modèle de taille

Une estimation courante vaut 2 × couches × têtes KV × dimension de tête × tokens en cache × octets par élément. Multiplier par les séquences actives lorsque les caches sont indépendants.

Leviers d’optimisation

Borner le contexte, regrouper les requêtes, utiliser GQA/MQA si le modèle le permet, paginer les blocs, réutiliser les préfixes vérifiés et évaluer séparément une précision de cache réduite.

Mesurer le service

Suivre TTFT, latence inter-token, débit, occupation du cache, évictions/recalculs et latences p50/p95 avec des contextes et une concurrence réalistes.

Ouvrir l’outil interactif

Vérification rapide

Que devient la mémoire KV si le contexte actif double ?

Afficher la réponse

Dans l’estimation linéaire simplifiée, elle double approximativement.

Le prompt caching fournisseur est-il identique au cache KV actif ?

Afficher la réponse

Non. La réutilisation de préfixe suit des règles propres au fournisseur.