DeepEval

LLM評価フレームワーク

現在も活発に開発中:直近 90 日間のコミットは 545 件、最新コミットは 2026-10-01。

GitHub スター
1.9万
直近 30 日のスター増加
+674
直近 90 日のコミット
545
直近 6 か月のリリース
10

DeepEvalは、大規模言語モデル(LLM)アプリケーションのテストと検証に特化したオープンソースの評価フレームワークです。Pytestに似たインターフェースを備え、LLM評価特有の課題に対応した、開発者になじみのあるテスト手法を提供します。このフレームワークには、G-Eval、タスク完了指標、回答の関連性評価、ハルシネーション検出などの最先端の研究手法が組み込まれており、いずれもLLM-as-a-judgeアプローチに基づいています。つまり、DeepEvalは高度な言語モデルを使って他の言語モデルを評価し、従来のルールベースのテストでは実現できない、細かなニュアンスと文脈を考慮した評価を提供します。GitHubで14,000を超えるスターを獲得したDeepEvalは、そのシンプルさと有効性により、AI開発コミュニティで広く支持されています。このフレームワークは、従来のソフトウェアテスト手法では不十分なLLM開発において、信頼できる評価手法への重要なニーズに対応します。標準化された指標と評価手順を提供することで、DeepEvalは、さまざまなシナリオやユースケースでLLMアプリケーションが安定して動作することを開発者が確認できるよう支援し、本番運用に耐えるAIシステムを構築するすべての人にとって不可欠なツールとなっています。

他ツールとの違い

Agent、RAG、マルチターン、MCP、マルチモーダルの指標を含む、研究に裏付けられた30+の指標を備えた、最も包括的なオープンソースLLM評価フレームワーク — Ragas(RAG専用)や独自の評価スクリプトとの比較

主な機能

  • 30+の組み込み指標によるLLM-as-a-judge評価
  • Agent指標(タスク完了、ツールの正確性、計画の遵守)
  • RAG指標(忠実性、関連性、コンテキストの再現率/適合率)
  • マルチターン会話の指標
  • MCP専用の評価指標
  • マルチモーダル評価(テキストからの画像生成、画像編集)
  • 合成データセットの生成
  • LLMアプリ向けのPytest形式のテストランナー

向いている用途

  • 包括的なLLM/Agent評価パイプラインを必要とするチーム
  • LLMアプリの品質ゲート向けのCI/CD統合
  • RAGパイプラインの評価と最適化

向いていない用途

  • 単純なルールベースの出力検証
  • LLM以外のソフトウェアテスト

制限事項

  • LLM-as-judge指標にはAPI呼び出しが必須(評価ごとの費用)
  • 複雑な指標設定による負担の可能性
  • Pythonのみ、JS/TS SDKなし
  • 一部の高度な機能による有料プラットフォームへの誘導

DeepEval の代替ツール

  • Ragas(1.6万スター)
  • Langfuse:オブザーバビリティ、評価、プロンプトおよびデータセット管理のためのオープンソースLLMエンジニアリングプラットフォーム(3.5万スター)
  • UpTrain(2,365スター)
  • langwatch:LLM評価とAI Agentテストのためのプラットフォーム(4,894スター)
  • phoenix:AIオブザーバビリティと評価(1.2万スター)
  • Agenta:プロンプトプレイグラウンド、プロンプト管理、LLM 評価、LLM オブザーバビリティを1か所に統合したオープンソースの LLMOps プラットフォームです。(4,799スター)

代替ツールの詳しい比較(英語)→

よくある質問

DeepEval とは?
DeepEvalは、大規模言語モデル(LLM)アプリケーションのテストと検証に特化したオープンソースの評価フレームワークです。Pytestに似たインターフェースを備え、LLM評価特有の課題に対応した、開発者になじみのあるテスト手法を提供します。このフレームワークには、G-Eval、タスク完了指標、回答の関連性評価、ハルシネーション検出などの最先端の研究手法が組み込まれており、いずれもLLM-as-a-judgeアプローチに基づいています。つまり、DeepEvalは高度な言語モデルを使って他の言語モデルを評価し、従来のルールベースのテストでは実現できない、細かなニュアンスと文脈を考慮した評価を提供します。GitHubで14,000を超えるスターを獲得したDeepEvalは、そのシンプルさと有効性により、AI開発コミュニティで広く支持されています。このフレームワークは、従来のソフトウェアテスト手法では不十分なLLM開発において、信頼できる評価手法への重要なニーズに対応します。標準化された指標と評価手順を提供することで、DeepEvalは、さまざまなシナリオやユースケースでLLMアプリケーションが安定して動作することを開発者が確認できるよう支援し、本番運用に耐えるAIシステムを構築するすべての人にとって不可欠なツールとなっています。
DeepEval は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 545 件、最新コミットは 2026-10-01。
DeepEval の代替ツールは?
DeepEval に近いオープンソースの代替ツール:Ragas、Langfuse、UpTrain、langwatch、phoenix、Agenta。
DeepEval はオープンソースですか?
はい。DeepEval はオープンソースで、コードは GitHub で公開されています。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/confident-ai/deepeval

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →