vLLM

LLM向けの高スループットでメモリ効率の高い推論・サービングエンジン

現在も活発に開発中:直近 90 日間のコミットは 3,946 件、最新コミットは 2026-10-01。

GitHub スター
9.3万
直近 30 日のスター増加
+2,951
直近 90 日のコミット
3,946
直近 6 か月のリリース
10

vLLMは、大規模言語モデル(LLM)専用に設計された高性能な推論・サービングエンジンです。当初はUC BerkeleyのSky Computing Labで開発され、効率的なLLMデプロイという重要なニーズに対応するコミュニティ主導のプロジェクトへと発展しました。このライブラリは、アテンションのキー・バリューメモリ管理を最適化するPagedAttentionや、受信リクエストの継続的バッチ処理などの革新的な手法により、高いサービングスループットを実現します。vLLMは、各種量子化手法(GPTQ、AWQ、INT4/8、FP8)、投機的デコーディング、チャンク化プリフィルなど、幅広い最適化手法をサポートします。広く使われているHugging Faceモデルとシームレスに統合でき、デプロイを容易にするOpenAI互換APIサーバーを提供します。このプラットフォームは、NVIDIA GPU、AMD CPU/GPU、Intelハードウェアに加え、TPUやIntel Gaudiなどの専用アクセラレーターを含む複数のハードウェア構成をサポートします。テンソル並列、パイプライン並列、データ並列などの機能により、vLLMは単一GPU構成から分散推論クラスターまでスケールします。Llamaのような標準的なTransformerベースのLLMから、Mixtralのような混合エキスパートモデル、埋め込みモデル、LLaVAのようなマルチモーダルLLMまで、多様なモデルアーキテクチャをサポートします。

他ツールとの違い

llama.cpp(コンシューマー向けハードウェアに重点を置いたC++ネイティブ実装)とは異なり、vLLMは本番環境のスループットで最高水準にあり、PagedAttentionによりデータセンターGPU上でHuggingFace Transformersの2-24xのスループットを実現します。

主な機能

  • PagedAttentionによるメモリ管理で実現する最先端のLLMサービングスループット
  • 継続的バッチ処理、CUDA/HIPグラフ実行、投機的デコーディング
  • 1.5ビットから8ビットの量子化(GPTQ、AWQ、AutoRound、INT4/8、FP8)
  • 分散推論向けのテンソル並列、パイプライン並列、データ並列、エキスパート並列
  • そのまま置き換え可能なOpenAI互換APIサーバー
  • プレフィックスキャッシュを備えたMulti-LoRAサービング
  • NVIDIA、AMD、IntelのGPU/CPU、TPU、カスタムハードウェアプラグインのサポート

向いている用途

  • PagedAttentionと継続的バッチ処理による最大スループットを必要とする本番LLMサービング
  • 本番環境で単一のベースモデルから複数のLoRAアダプターを提供するチーム

向いていない用途

  • ノートPCやコンシューマー向けGPUでのモデル実行 — 強力な量子化を適用したllama.cppの使用
  • マネージドLLM APIのニーズ — LiteLLMプロキシまたはクラウドプロバイダーの直接利用

制限事項

  • 主にデータセンター/サーバーへのデプロイ向けの設計 — エッジやモバイル向けには未最適化
  • 量子化しない大規模モデルでの高いGPUメモリ要件
  • モデルのファインチューニング機能の内蔵なし — 推論とサービングのみ

vLLM の代替ツール

代替ツールの詳しい比較(英語)→

よくある質問

vLLM とは?
vLLMは、大規模言語モデル(LLM)専用に設計された高性能な推論・サービングエンジンです。当初はUC BerkeleyのSky Computing Labで開発され、効率的なLLMデプロイという重要なニーズに対応するコミュニティ主導のプロジェクトへと発展しました。このライブラリは、アテンションのキー・バリューメモリ管理を最適化するPagedAttentionや、受信リクエストの継続的バッチ処理などの革新的な手法により、高いサービングスループットを実現します。vLLMは、各種量子化手法(GPTQ、AWQ、INT4/8、FP8)、投機的デコーディング、チャンク化プリフィルなど、幅広い最適化手法をサポートします。広く使われているHugging Faceモデルとシームレスに統合でき、デプロイを容易にするOpenAI互換APIサーバーを提供します。このプラットフォームは、NVIDIA GPU、AMD CPU/GPU、Intelハードウェアに加え、TPUやIntel Gaudiなどの専用アクセラレーターを含む複数のハードウェア構成をサポートします。テンソル並列、パイプライン並列、データ並列などの機能により、vLLMは単一GPU構成から分散推論クラスターまでスケールします。Llamaのような標準的なTransformerベースのLLMから、Mixtralのような混合エキスパートモデル、埋め込みモデル、LLaVAのようなマルチモーダルLLMまで、多様なモデルアーキテクチャをサポートします。
vLLM は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 3,946 件、最新コミットは 2026-10-01。
vLLM の代替ツールは?
vLLM に近いオープンソースの代替ツール:Text Generation Inference、llama.cpp、llama-cpp-python、Ollama、OpenLLM、MLC LLM。
vLLM はオープンソースですか?
はい。vLLM はオープンソースで、コードは GitHub で公開されています。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/vllm-project/vllm

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →