vLLM
LLM向けの高スループットでメモリ効率の高い推論・サービングエンジン
現在も活発に開発中:直近 90 日間のコミットは 3,946 件、最新コミットは 2026-10-01。
vLLMは、大規模言語モデル(LLM)専用に設計された高性能な推論・サービングエンジンです。当初はUC BerkeleyのSky Computing Labで開発され、効率的なLLMデプロイという重要なニーズに対応するコミュニティ主導のプロジェクトへと発展しました。このライブラリは、アテンションのキー・バリューメモリ管理を最適化するPagedAttentionや、受信リクエストの継続的バッチ処理などの革新的な手法により、高いサービングスループットを実現します。vLLMは、各種量子化手法(GPTQ、AWQ、INT4/8、FP8)、投機的デコーディング、チャンク化プリフィルなど、幅広い最適化手法をサポートします。広く使われているHugging Faceモデルとシームレスに統合でき、デプロイを容易にするOpenAI互換APIサーバーを提供します。このプラットフォームは、NVIDIA GPU、AMD CPU/GPU、Intelハードウェアに加え、TPUやIntel Gaudiなどの専用アクセラレーターを含む複数のハードウェア構成をサポートします。テンソル並列、パイプライン並列、データ並列などの機能により、vLLMは単一GPU構成から分散推論クラスターまでスケールします。Llamaのような標準的なTransformerベースのLLMから、Mixtralのような混合エキスパートモデル、埋め込みモデル、LLaVAのようなマルチモーダルLLMまで、多様なモデルアーキテクチャをサポートします。
他ツールとの違い
llama.cpp(コンシューマー向けハードウェアに重点を置いたC++ネイティブ実装)とは異なり、vLLMは本番環境のスループットで最高水準にあり、PagedAttentionによりデータセンターGPU上でHuggingFace Transformersの2-24xのスループットを実現します。
主な機能
- PagedAttentionによるメモリ管理で実現する最先端のLLMサービングスループット
- 継続的バッチ処理、CUDA/HIPグラフ実行、投機的デコーディング
- 1.5ビットから8ビットの量子化(GPTQ、AWQ、AutoRound、INT4/8、FP8)
- 分散推論向けのテンソル並列、パイプライン並列、データ並列、エキスパート並列
- そのまま置き換え可能なOpenAI互換APIサーバー
- プレフィックスキャッシュを備えたMulti-LoRAサービング
- NVIDIA、AMD、IntelのGPU/CPU、TPU、カスタムハードウェアプラグインのサポート
向いている用途
- PagedAttentionと継続的バッチ処理による最大スループットを必要とする本番LLMサービング
- 本番環境で単一のベースモデルから複数のLoRAアダプターを提供するチーム
向いていない用途
- ノートPCやコンシューマー向けGPUでのモデル実行 — 強力な量子化を適用したllama.cppの使用
- マネージドLLM APIのニーズ — LiteLLMプロキシまたはクラウドプロバイダーの直接利用
制限事項
- 主にデータセンター/サーバーへのデプロイ向けの設計 — エッジやモバイル向けには未最適化
- 量子化しない大規模モデルでの高いGPUメモリ要件
- モデルのファインチューニング機能の内蔵なし — 推論とサービングのみ
vLLM の代替ツール
- Text Generation Inference(1.1万スター)
- llama.cpp:C/C++によるLLM推論(13万スター)
- llama-cpp-python(1.1万スター)
- Ollama:Kimi-K2.5、GLM-5、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma などのモデルをすぐに使い始められます。(18.2万スター)
- OpenLLM(1.3万スター)
- MLC LLM(2.3万スター)
よくある質問
- vLLM とは?
- vLLMは、大規模言語モデル(LLM)専用に設計された高性能な推論・サービングエンジンです。当初はUC BerkeleyのSky Computing Labで開発され、効率的なLLMデプロイという重要なニーズに対応するコミュニティ主導のプロジェクトへと発展しました。このライブラリは、アテンションのキー・バリューメモリ管理を最適化するPagedAttentionや、受信リクエストの継続的バッチ処理などの革新的な手法により、高いサービングスループットを実現します。vLLMは、各種量子化手法(GPTQ、AWQ、INT4/8、FP8)、投機的デコーディング、チャンク化プリフィルなど、幅広い最適化手法をサポートします。広く使われているHugging Faceモデルとシームレスに統合でき、デプロイを容易にするOpenAI互換APIサーバーを提供します。このプラットフォームは、NVIDIA GPU、AMD CPU/GPU、Intelハードウェアに加え、TPUやIntel Gaudiなどの専用アクセラレーターを含む複数のハードウェア構成をサポートします。テンソル並列、パイプライン並列、データ並列などの機能により、vLLMは単一GPU構成から分散推論クラスターまでスケールします。Llamaのような標準的なTransformerベースのLLMから、Mixtralのような混合エキスパートモデル、埋め込みモデル、LLaVAのようなマルチモーダルLLMまで、多様なモデルアーキテクチャをサポートします。
- vLLM は現在もメンテナンスされていますか?
- 現在も活発に開発中:直近 90 日間のコミットは 3,946 件、最新コミットは 2026-10-01。
- vLLM の代替ツールは?
- vLLM に近いオープンソースの代替ツール:Text Generation Inference、llama.cpp、llama-cpp-python、Ollama、OpenLLM、MLC LLM。
- vLLM はオープンソースですか?
- はい。vLLM はオープンソースで、コードは GitHub で公開されています。
スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/vllm-project/vllm