它是什么
vLLM 是加州大学伯克利分校团队 2023 年发布的开源推理与服务引擎。它用 PagedAttention 把注意力缓存按页管理,缓解显存碎片,并配合连续批处理提升吞吐。它面向的是大模型推理服务中显存利用与并发效率的问题。
为什么值得记住
PagedAttention 把 KV 缓存的分页问题解决掉,让同卡吞吐大幅提升,成为开源推理服务被广泛借鉴的基础。
关键规格
- 核心技术
- PagedAttention 分页式 KV 缓存
- 调度
- 连续批处理
- 接口
- OpenAI 风格服务接口
它是什么
vLLM 是加州大学伯克利分校团队 2023 年发布的开源推理与服务引擎。它用 PagedAttention 把注意力缓存按页管理,缓解显存碎片,并配合连续批处理提升吞吐。它面向的是大模型推理服务中显存利用与并发效率的问题。
为什么值得记住
PagedAttention 把 KV 缓存的分页问题解决掉,让同卡吞吐大幅提升,成为开源推理服务被广泛借鉴的基础。