تحسين ذاكرة التخزين المؤقت KV: كفاءة الذاكرة لنماذج اللغة الكبيرة في الإنتاج
الاستدلال التقليدي يهدر 60-80% من ذاكرة التخزين المؤقت KV بسبب التجزئة. تقنية PagedAttention من vLLM تقلل الهدر إلى أقل من 4%، مما يتيح مضاعفة الإنتاجية 2-4 مرات. نموذج 70B مع سياق 8K يتطلب حوالي 20GB...