KV-Cache-Optimierung: Speichereffizienz für LLMs in der Produktion
Traditionelle Inferenz verschwendet 60-80% des KV-Cache-Speichers durch Fragmentierung. vLLMs PagedAttention reduziert die Verschwendung auf unter 4% und ermöglicht 2-4-fachen Durchsatz. Ein 70B-Model...