vLLM
面向 LLM 的高吞吐量、内存高效的推理与服务引擎
仍在活跃开发:最近 90 天有 3,946 次提交,最近一次提交在 2026-10-01。
vLLM 是专为大型语言模型(LLM)设计的高性能推理与服务引擎。它最初由 UC Berkeley 的 Sky Computing Lab 开发,现已发展为社区驱动的项目,满足高效部署 LLM 的关键需求。该库通过 PagedAttention 等创新技术以及对传入请求进行连续批处理,实现出色的服务吞吐量;其中,PagedAttention 优化了注意力键值内存管理。vLLM 支持全面的优化技术,包括多种量化方法(GPTQ、AWQ、INT4/8、FP8)、推测解码和分块预填充。它可与常用的 Hugging Face 模型无缝集成,并提供兼容 OpenAI 的 API 服务器,便于部署。该平台支持多种硬件配置,包括 NVIDIA GPU、AMD CPU/GPU、Intel 硬件,甚至 TPU 和 Intel Gaudi 等专用加速器。借助张量并行、流水线并行和数据并行等功能,vLLM 可从单 GPU 配置扩展到分布式推理集群。它支持多种模型架构,包括 Llama 等基于 transformer 的标准 LLM、Mixtral 等混合专家模型、嵌入模型,以及 LLaVA 等多模态 LLM。
和同类工具的区别
与 llama.cpp(面向消费级硬件、原生 C++)不同,vLLM 在生产环境吞吐量方面领先,借助 PagedAttention,在数据中心 GPU 上实现 HuggingFace Transformers 的 2-24x 吞吐量
主要能力
- 通过 PagedAttention 内存管理实现业界领先的 LLM 服务吞吐量
- 连续批处理、CUDA/HIP 图执行和推测解码
- 1.5-bit 至 8-bit 量化(GPTQ、AWQ、AutoRound、INT4/8、FP8)
- 用于分布式推理的张量并行、流水线并行、数据并行和专家并行
- 兼容 OpenAI 的 API 服务器,可直接替换
- 支持前缀缓存的多 LoRA 服务
- 支持 NVIDIA、AMD、Intel GPU/CPU、TPU 及自定义硬件插件
适合
- 需要借助 PagedAttention 和连续批处理实现最大吞吐量的生产环境 LLM 服务
- 在生产环境中基于单个基础模型提供多个 LoRA 适配器服务的团队
不太适合
- 在笔记本电脑或消费级 GPU 上运行模型——请使用 llama.cpp 并采用激进量化
- 托管 LLM API 需求——请使用 LiteLLM 代理或直接使用云服务提供商
局限
- 主要针对数据中心/服务器部署设计——未针对边缘或移动设备优化
- 未量化的大型模型对 GPU 显存要求较高
- 不内置模型微调功能——仅支持推理与服务
vLLM 的替代品
- Text Generation Inference(1.1 万星)
- llama.cpp:使用 C/C++ 进行 LLM 推理(13 万星)
- llama-cpp-python(1.1 万星)
- Ollama(18.2 万星)
- OpenLLM(1.3 万星)
- MLC LLM(2.3 万星)
常见问题
- vLLM 是做什么的?
- vLLM 是专为大型语言模型(LLM)设计的高性能推理与服务引擎。它最初由 UC Berkeley 的 Sky Computing Lab 开发,现已发展为社区驱动的项目,满足高效部署 LLM 的关键需求。该库通过 PagedAttention 等创新技术以及对传入请求进行连续批处理,实现出色的服务吞吐量;其中,PagedAttention 优化了注意力键值内存管理。vLLM 支持全面的优化技术,包括多种量化方法(GPTQ、AWQ、INT4/8、FP8)、推测解码和分块预填充。它可与常用的 Hugging Face 模型无缝集成,并提供兼容 OpenAI 的 API 服务器,便于部署。该平台支持多种硬件配置,包括 NVIDIA GPU、AMD CPU/GPU、Intel 硬件,甚至 TPU 和 Intel Gaudi 等专用加速器。借助张量并行、流水线并行和数据并行等功能,vLLM 可从单 GPU 配置扩展到分布式推理集群。它支持多种模型架构,包括 Llama 等基于 transformer 的标准 LLM、Mixtral 等混合专家模型、嵌入模型,以及 LLaVA 等多模态 LLM。
- vLLM 还在维护吗?
- 仍在活跃开发:最近 90 天有 3,946 次提交,最近一次提交在 2026-10-01。
- vLLM 有哪些替代品?
- 和 vLLM 最接近的开源替代品有 Text Generation Inference、llama.cpp、llama-cpp-python、Ollama、OpenLLM、MLC LLM。
- vLLM 是开源的吗?
- 是的,vLLM 是开源项目,代码托管在 GitHub 上。
星数、提交和发版数据来自 GitHub API,每天自动刷新。介绍文字由 AI 从英文翻译,并经过第二个模型的回译校对。 项目地址:github.com/vllm-project/vllm