vLLM
Motor de inferencia y servicio de alto rendimiento para LLM
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
vLLM is an open-source inference and serving engine released in 2023 by a team at UC Berkeley. Its PagedAttention manages attention caches in pages to ease memory fragmentation, paired with continuous batching to raise throughput. It targets memory utilisation and concurrency efficiency in large-model serving.
Por qué merece la pena recordarlo
PagedAttention solved paging of the KV cache, raising per-GPU throughput substantially and becoming a widely adopted base for open-source serving.
Especificaciones clave
- Key technique
- PagedAttention paged KV cache
- Scheduling
- Continuous batching
- Interface
- OpenAI-compatible serving API
Conceptos relacionados
Optimización y servicio de inferencia
El entrenamiento ocurre una vez; la inferencia, miles de millones de veces al día — y el primer token y el rendimiento suelen oponerse
Compresión de modelos
Hacer un modelo más pequeño, rápido y barato sin apenas perder precisión — aunque rara vez los tres a la vez