llama.cpp
C/C++によるLLM推論
現在も活発に開発中:直近 90 日間のコミットは 1,467 件、最新コミットは 2026-10-01。
llama.cppは、最小限の依存関係で大規模言語モデルをローカルで実行できる、C/C++で書かれた高性能なLLM推論エンジンです。GitHubスター数は100,000近くに達し、ローカルAI推論の事実上の標準となっています。このプロジェクトはGGUF形式を用いた効率的なモデル実行に重点を置き、幅広いモデルアーキテクチャと量子化レベルをサポートしています。llama.cppには、コマンドラインツールと、アプリケーションに組み込むためのREST APIサーバー(llama-server)の両方が含まれています。最近の開発には、ビジョンモデル向けのマルチモーダル対応、Hugging Faceエコシステムとのネイティブ統合、NVIDIAとの協業に向けたMXFP4などの特殊なモデル形式への対応が含まれます。このツールキットは、シンプルなCLI利用からDockerコンテナまで複数のデプロイ方法を提供し、コード補完タスク向けにVS CodeやVim/Neovimなどの一般的なコードエディター用の公式拡張機能も備えています。C/C++を基盤とすることで、さまざまなハードウェア構成で最適なパフォーマンスを確保しており、Pythonベースの代替手段ではリソース消費が過大になり得るエッジへのデプロイで特に有用です。
他ツールとの違い
データセンターのスループットに最適化されたvLLMとは異なり、llama.cppは最も幅広い量子化範囲(1.5ビットから8ビット)を備え、Raspberry PiからマルチGPUサーバーまで、最大限のハードウェア互換性を目指しています。
主な機能
- 外部依存関係なしの純粋なC/C++によるLLM推論
- メモリ削減と推論高速化のための1.5ビットから8ビットの整数量子化
- ARM NEON、Accelerate、MetalフレームワークによるApple Silicon向け最適化
- カスタムCUDAカーネルによるNVIDIA GPUの高速化、HIPによるAMDの高速化、MUSAによるMoore Threadsの高速化
- VRAM容量を超えるモデル向けのCPU+GPUハイブリッド推論
- OpenAI互換のREST APIサーバー(llama-server)
- 視覚言語モデル向けのマルチモーダル対応
- FIMコード補完向けのVS CodeおよびVim/Neovim拡張機能
向いている用途
- 積極的な量子化(1.5ビットから8ビット)を用いたコンシューマー向けハードウェア上でのLLM実行
- エッジデバイスやノートPCへのOpenAI互換ローカルAPIサーバーのデプロイ
向いていない用途
- 本番規模の高スループットなサービング — 代わりにPagedAttentionを備えたvLLMを使用
- モデルの学習やファインチューニング — Hugging Face TransformersまたはAxolotlを使用
制限事項
- 主にGGUF形式に最適化 — 他の形式は変換が必要
- 高度な機能(投機的デコーディング、チャンク化プリフィル)は手動設定が必要
- モデルのファインチューニング機能は非搭載 — 推論専用
llama.cpp の代替ツール
- vLLM:LLM向けの高スループットでメモリ効率の高い推論・サービングエンジン(9.3万スター)
- MLC LLM(2.3万スター)
- PowerInfer(9,814スター)
- Mistral Inference(1.1万スター)
- Text Generation Inference(1.1万スター)
- Ollama:Kimi-K2.5、GLM-5、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma などのモデルをすぐに使い始められます。(18.2万スター)
よくある質問
- llama.cpp とは?
- llama.cppは、最小限の依存関係で大規模言語モデルをローカルで実行できる、C/C++で書かれた高性能なLLM推論エンジンです。GitHubスター数は100,000近くに達し、ローカルAI推論の事実上の標準となっています。このプロジェクトはGGUF形式を用いた効率的なモデル実行に重点を置き、幅広いモデルアーキテクチャと量子化レベルをサポートしています。llama.cppには、コマンドラインツールと、アプリケーションに組み込むためのREST APIサーバー(llama-server)の両方が含まれています。最近の開発には、ビジョンモデル向けのマルチモーダル対応、Hugging Faceエコシステムとのネイティブ統合、NVIDIAとの協業に向けたMXFP4などの特殊なモデル形式への対応が含まれます。このツールキットは、シンプルなCLI利用からDockerコンテナまで複数のデプロイ方法を提供し、コード補完タスク向けにVS CodeやVim/Neovimなどの一般的なコードエディター用の公式拡張機能も備えています。C/C++を基盤とすることで、さまざまなハードウェア構成で最適なパフォーマンスを確保しており、Pythonベースの代替手段ではリソース消費が過大になり得るエッジへのデプロイで特に有用です。
- llama.cpp は現在もメンテナンスされていますか?
- 現在も活発に開発中:直近 90 日間のコミットは 1,467 件、最新コミットは 2026-10-01。
- llama.cpp の代替ツールは?
- llama.cpp に近いオープンソースの代替ツール:vLLM、MLC LLM、PowerInfer、Mistral Inference、Text Generation Inference、Ollama。
- llama.cpp はオープンソースですか?
- はい。llama.cpp はオープンソースで、コードは GitHub で公開されています。
スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/ggml-org/llama.cpp