llama.cpp

C/C++によるLLM推論

現在も活発に開発中:直近 90 日間のコミットは 1,467 件、最新コミットは 2026-10-01。

GitHub スター
13万
直近 30 日のスター増加
+4,859
直近 90 日のコミット
1,467
直近 6 か月のリリース
10

llama.cppは、最小限の依存関係で大規模言語モデルをローカルで実行できる、C/C++で書かれた高性能なLLM推論エンジンです。GitHubスター数は100,000近くに達し、ローカルAI推論の事実上の標準となっています。このプロジェクトはGGUF形式を用いた効率的なモデル実行に重点を置き、幅広いモデルアーキテクチャと量子化レベルをサポートしています。llama.cppには、コマンドラインツールと、アプリケーションに組み込むためのREST APIサーバー(llama-server)の両方が含まれています。最近の開発には、ビジョンモデル向けのマルチモーダル対応、Hugging Faceエコシステムとのネイティブ統合、NVIDIAとの協業に向けたMXFP4などの特殊なモデル形式への対応が含まれます。このツールキットは、シンプルなCLI利用からDockerコンテナまで複数のデプロイ方法を提供し、コード補完タスク向けにVS CodeやVim/Neovimなどの一般的なコードエディター用の公式拡張機能も備えています。C/C++を基盤とすることで、さまざまなハードウェア構成で最適なパフォーマンスを確保しており、Pythonベースの代替手段ではリソース消費が過大になり得るエッジへのデプロイで特に有用です。

他ツールとの違い

データセンターのスループットに最適化されたvLLMとは異なり、llama.cppは最も幅広い量子化範囲(1.5ビットから8ビット)を備え、Raspberry PiからマルチGPUサーバーまで、最大限のハードウェア互換性を目指しています。

主な機能

  • 外部依存関係なしの純粋なC/C++によるLLM推論
  • メモリ削減と推論高速化のための1.5ビットから8ビットの整数量子化
  • ARM NEON、Accelerate、MetalフレームワークによるApple Silicon向け最適化
  • カスタムCUDAカーネルによるNVIDIA GPUの高速化、HIPによるAMDの高速化、MUSAによるMoore Threadsの高速化
  • VRAM容量を超えるモデル向けのCPU+GPUハイブリッド推論
  • OpenAI互換のREST APIサーバー(llama-server)
  • 視覚言語モデル向けのマルチモーダル対応
  • FIMコード補完向けのVS CodeおよびVim/Neovim拡張機能

向いている用途

  • 積極的な量子化(1.5ビットから8ビット)を用いたコンシューマー向けハードウェア上でのLLM実行
  • エッジデバイスやノートPCへのOpenAI互換ローカルAPIサーバーのデプロイ

向いていない用途

  • 本番規模の高スループットなサービング — 代わりにPagedAttentionを備えたvLLMを使用
  • モデルの学習やファインチューニング — Hugging Face TransformersまたはAxolotlを使用

制限事項

  • 主にGGUF形式に最適化 — 他の形式は変換が必要
  • 高度な機能(投機的デコーディング、チャンク化プリフィル)は手動設定が必要
  • モデルのファインチューニング機能は非搭載 — 推論専用

llama.cpp の代替ツール

  • vLLM:LLM向けの高スループットでメモリ効率の高い推論・サービングエンジン(9.3万スター)
  • MLC LLM(2.3万スター)
  • PowerInfer(9,814スター)
  • Mistral Inference(1.1万スター)
  • Text Generation Inference(1.1万スター)
  • Ollama:Kimi-K2.5、GLM-5、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma などのモデルをすぐに使い始められます。(18.2万スター)

代替ツールの詳しい比較(英語)→

よくある質問

llama.cpp とは?
llama.cppは、最小限の依存関係で大規模言語モデルをローカルで実行できる、C/C++で書かれた高性能なLLM推論エンジンです。GitHubスター数は100,000近くに達し、ローカルAI推論の事実上の標準となっています。このプロジェクトはGGUF形式を用いた効率的なモデル実行に重点を置き、幅広いモデルアーキテクチャと量子化レベルをサポートしています。llama.cppには、コマンドラインツールと、アプリケーションに組み込むためのREST APIサーバー(llama-server)の両方が含まれています。最近の開発には、ビジョンモデル向けのマルチモーダル対応、Hugging Faceエコシステムとのネイティブ統合、NVIDIAとの協業に向けたMXFP4などの特殊なモデル形式への対応が含まれます。このツールキットは、シンプルなCLI利用からDockerコンテナまで複数のデプロイ方法を提供し、コード補完タスク向けにVS CodeやVim/Neovimなどの一般的なコードエディター用の公式拡張機能も備えています。C/C++を基盤とすることで、さまざまなハードウェア構成で最適なパフォーマンスを確保しており、Pythonベースの代替手段ではリソース消費が過大になり得るエッジへのデプロイで特に有用です。
llama.cpp は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 1,467 件、最新コミットは 2026-10-01。
llama.cpp の代替ツールは?
llama.cpp に近いオープンソースの代替ツール:vLLM、MLC LLM、PowerInfer、Mistral Inference、Text Generation Inference、Ollama。
llama.cpp はオープンソースですか?
はい。llama.cpp はオープンソースで、コードは GitHub で公開されています。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/ggml-org/llama.cpp

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →