Promptfoo

プロンプト、Agent、RAGシステム、LLMアプリの評価とレッドチーミングのためのオープンソースCLIおよびライブラリ

現在も活発に開発中:直近 90 日間のコミットは 906 件、最新コミットは 2026-10-01。

GitHub スター
2.6万
直近 30 日のスター増加
+1,114
直近 90 日のコミット
906
直近 6 か月のリリース
10

Promptfooは、LLMアプリケーションの評価とレッドチーミング向けに設計された包括的なCLIおよびライブラリです。AIシステムの体系的なテストとセキュリティ評価に対する重要なニーズに対応し、チームが試行錯誤によるアプローチから、信頼性と安全性の高いAI開発へ移行できるようにします。OpenAI、Anthropic、Azure、Bedrock、Ollamaを含む複数のLLMプロバイダーにわたり、プロンプト、Agent、RAGシステムの自動評価をサポートします。基本的なテストに加え、PromptfooはLLMアプリケーションの脆弱性スキャンとセキュリティ評価のための高度なレッドチーミング機能を提供します。モデルを並べて比較する機能により、チームがモデル選択とパフォーマンス最適化について情報に基づいた判断を下せるよう支援します。このプラットフォームはCI/CDパイプラインにシームレスに統合され、LLM関連のセキュリティおよびコンプライアンス上の問題に対する自動チェックとプルリクエストレビューを可能にします。宣言的な設定アプローチとWebベースの結果ビューアにより、Promptfooではチーム間での結果共有と継続的な改善の追跡が容易になります。最近OpenAIに買収され、オープンソースのMITライセンスを維持しているこのツールは、18,000を超えるGitHubスターと活発なコミュニティの支援により、その価値を実証しています。

他ツールとの違い

LangSmith(本番環境のオブザーバビリティ)やLangfuse(ロギング)とは異なり、Promptfooは評価 + レッドチーミング + CI/CDコードスキャンを組み合わせた唯一のオープンソースツールです。現在はOpenAIの支援を受けながら、引き続き全体にMITライセンスを適用しています。

主な機能

  • プロバイダーを横断してモデルを並べて比較するLLM自動評価
  • LLMアプリケーションのセキュリティのためのレッドチーミングと脆弱性スキャン
  • プロンプトの自動回帰テストのためのCI/CD統合
  • PR内のLLM関連のセキュリティおよびコンプライアンス上の問題を検出するコードスキャン
  • アサーションベースの採点による評価結果を可視化するWeb UI
  • 100%ローカル実行 — プロンプトをマシン外に一切送信しない実行方式

向いている用途

  • 自動レッドチーミングでプロンプトインジェクションやジェイルブレイクに対するLLMアプリの耐性を強化するチーム
  • CI/CDパイプラインにLLM評価の回帰テストを追加するエンジニアリングチーム

向いていない用途

  • AI Agentの構築やデプロイ — Agent開発にはLangGraphまたはCrewAIを使用
  • 本番環境のリアルタイム監視 — オブザーバビリティにはLangSmithまたはLangfuseを使用

制限事項

  • 評価専用 — LLMアプリケーションのデプロイや配信は非対応
  • 複雑な評価設定にはYAMLの専門知識が必要
  • レッドチーミングの有効性は攻撃戦略の網羅範囲に依存

Promptfoo の代替ツール

  • ChainForge(3,032スター)
  • Langfuse:オブザーバビリティ、評価、プロンプトおよびデータセット管理のためのオープンソースLLMエンジニアリングプラットフォーム(3.5万スター)
  • phoenix:AIオブザーバビリティと評価(1.2万スター)
  • Agenta:プロンプトプレイグラウンド、プロンプト管理、LLM 評価、LLM オブザーバビリティを1か所に統合したオープンソースの LLMOps プラットフォームです。(4,799スター)
  • DeepEval:LLM評価フレームワーク(1.9万スター)
  • UpTrain(2,365スター)

代替ツールの詳しい比較(英語)→

よくある質問

Promptfoo とは?
Promptfooは、LLMアプリケーションの評価とレッドチーミング向けに設計された包括的なCLIおよびライブラリです。AIシステムの体系的なテストとセキュリティ評価に対する重要なニーズに対応し、チームが試行錯誤によるアプローチから、信頼性と安全性の高いAI開発へ移行できるようにします。OpenAI、Anthropic、Azure、Bedrock、Ollamaを含む複数のLLMプロバイダーにわたり、プロンプト、Agent、RAGシステムの自動評価をサポートします。基本的なテストに加え、PromptfooはLLMアプリケーションの脆弱性スキャンとセキュリティ評価のための高度なレッドチーミング機能を提供します。モデルを並べて比較する機能により、チームがモデル選択とパフォーマンス最適化について情報に基づいた判断を下せるよう支援します。このプラットフォームはCI/CDパイプラインにシームレスに統合され、LLM関連のセキュリティおよびコンプライアンス上の問題に対する自動チェックとプルリクエストレビューを可能にします。宣言的な設定アプローチとWebベースの結果ビューアにより、Promptfooではチーム間での結果共有と継続的な改善の追跡が容易になります。最近OpenAIに買収され、オープンソースのMITライセンスを維持しているこのツールは、18,000を超えるGitHubスターと活発なコミュニティの支援により、その価値を実証しています。
Promptfoo は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 906 件、最新コミットは 2026-10-01。
Promptfoo の代替ツールは?
Promptfoo に近いオープンソースの代替ツール:ChainForge、Langfuse、phoenix、Agenta、DeepEval、UpTrain。
Promptfoo はオープンソースですか?
はい。Promptfoo はオープンソースで、コードは GitHub で公開されています。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/promptfoo/promptfoo

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →