Optimisasi KV Cache: Efisiensi Memori untuk LLM Produksi
Inferensi tradisional memboroskan 60-80% memori KV cache melalui fragmentasi. PagedAttention vLLM mengurangi pemborosan hingga di bawah 4%, memungkinkan throughput 2-4x. Model 70B dengan konteks 8K me...