跳到正文
AI 图鉴

vLLM

高吞吐的 LLM 推理与服务引擎

UC Berkeley (LMSYS) 工具 开源

它是什么

vLLM 是加州大学伯克利分校团队 2023 年发布的开源推理与服务引擎。它用 PagedAttention 把注意力缓存按页管理,缓解显存碎片,并配合连续批处理提升吞吐。它面向的是大模型推理服务中显存利用与并发效率的问题。

为什么值得记住

PagedAttention 把 KV 缓存的分页问题解决掉,让同卡吞吐大幅提升,成为开源推理服务被广泛借鉴的基础。

关键规格

核心技术
PagedAttention 分页式 KV 缓存
调度
连续批处理
接口
OpenAI 风格服务接口

相关概念

同类产品