يُعرض النص الكامل باللغة الإنجليزية؛ وقد تمت ترجمة العنوان والملخص.
ما هو
vLLM is an open-source inference and serving engine released in 2023 by a team at UC Berkeley. Its PagedAttention manages attention caches in pages to ease memory fragmentation, paired with continuous batching to raise throughput. It targets memory utilisation and concurrency efficiency in large-model serving.
لماذا يستحق التذكّر
PagedAttention solved paging of the KV cache, raising per-GPU throughput substantially and becoming a widely adopted base for open-source serving.
المواصفات الأساسية
- Key technique
- PagedAttention paged KV cache
- Scheduling
- Continuous batching
- Interface
- OpenAI-compatible serving API
المفاهيم ذات الصلة
متوسط
تحسين الاستدلال وتقديم الخدمة
يحدث التدريب مرة واحدة، أما الاستدلال فمليارات المرات يوميًا — وسرعة التوكن الأول والإنتاجية تتعارضان غالبًا
هندسة الذكاء الاصطناعي وسلامته وأخلاقياته
متوسط
ضغط النماذج
تصغير النموذج وتسريعه وتخفيض تكلفته دون خسارة كبيرة في الدقة — لكن الجمع بين الثلاثة نادر
هندسة الذكاء الاصطناعي وسلامته وأخلاقياته