vLLM
Motor de inferência e serviço de alta vazão para LLMs
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
vLLM is an open-source inference and serving engine released in 2023 by a team at UC Berkeley. Its PagedAttention manages attention caches in pages to ease memory fragmentation, paired with continuous batching to raise throughput. It targets memory utilisation and concurrency efficiency in large-model serving.
Por que vale a pena lembrar
PagedAttention solved paging of the KV cache, raising per-GPU throughput substantially and becoming a widely adopted base for open-source serving.
Especificações-chave
- Key technique
- PagedAttention paged KV cache
- Scheduling
- Continuous batching
- Interface
- OpenAI-compatible serving API
Conceitos relacionados
Otimização e serviço de inferência
O treino ocorre uma vez; a inferência, bilhões de vezes por dia — e o primeiro token e a vazão costumam se opor
Compressão de modelos
Tornar um modelo menor, mais rápido e mais barato quase sem perder precisão — mas raramente os três ao mesmo tempo