Optimisation du KV Cache : Efficacité Mémoire pour les LLM en Production
L'inférence traditionnelle gaspille 60 à 80 % de la mémoire du KV cache par fragmentation. Le PagedAttention de vLLM réduit ce gaspillage à moins de 4 %, permettant un débit 2 à 4 fois supérieur. Un m...