Otimização de Cache KV: Eficiência de Memória para LLMs em Produção
Inferência tradicional desperdiçando 60-80% da memória de cache KV através de fragmentação. PagedAttention do vLLM reduzindo desperdício para menos de 4%, permitindo 2-4x de throughput. Modelo de 70B ...