langwatch

LLM評価とAI Agentテストのためのプラットフォーム

現在も活発に開発中:直近 90 日間のコミットは 1,561 件、最新コミットは 2026-10-01。

GitHub スター
4,894
直近 30 日のスター増加
+276
直近 90 日のコミット
1,561
直近 6 か月のリリース
10

LangWatchは、LLM評価とAI Agentテスト向けに設計された包括的なプラットフォームです。開発中と本番環境の両方で、AIを活用したAgentのテスト、シミュレーション、評価、監視をエンドツーエンドで行う機能をチームに提供します。独自のツール基盤を必要とせず、回帰テストと本番環境のオブザーバビリティに対する重要なニーズに対応します。LangWatchの特徴は、ツール、状態、ユーザーシミュレーター、判定器を含むスタック全体を対象にテストする、現実的なAgentシミュレーションです。これにより、Agentがどこで、なぜ動作しなくなるのかをチームが正確に特定できるようにします。評価、オブザーバビリティ、プロンプト管理を統一されたワークフローに統合し、性能のトレース、データセットの作成、結果の評価、プロンプトとモデルの最適化、再テストをシームレスなループで行えるようにします。オープン標準に基づき、OpenTelemetry/OTLPをネイティブにサポートするLangWatchは、特定のフレームワークやLLMプロバイダーに依存せず、ベンダーロックインが生じないことを保証します。実行結果のレビュー、失敗へのアノテーション、アノテーションキューなどの機能を通じてコラボレーションを促進し、ドメインの専門家がエッジケースに効率よくラベル付けできるようにします。プロンプトのバージョン管理のためのGitHub連携と、容易に統合できるPythonおよびnpmパッケージを備えたLangWatchは、独自の評価基盤を構築する負担なしに、AI Agent向けの堅牢なテストと監視機能を必要とするチームに対応します。

他ツールとの違い

Agentシミュレーション、評価、オブザーバビリティ、プロンプト最適化を組み合わせた、OpenTelemetryネイティブ設計の統合プラットフォーム — トレース(Langfuse)、評価(DeepEval)、プロンプト管理に個別のツールを使う構成との違い

主な機能

  • エンドツーエンドのAgentシミュレーションテスト
  • LLMのトレースとオブザーバビリティ(OpenTelemetryネイティブ)
  • LLM判定器によるオフラインおよびオンライン評価
  • GitHub連携によるプロンプト管理
  • プロンプトとモデルの最適化スタジオ
  • 人手によるラベル付けのためのアノテーションワークフロー
  • コストと性能の監視

向いている用途

  • 評価 + オブザーバビリティ + プロンプト管理を1つのツールで行いたいチーム
  • 本番デプロイ前のAgentシミュレーションテスト
  • OpenTelemetryネイティブのLLMオブザーバビリティを必要とする組織

向いていない用途

  • 評価なしの単純なログ記録のみを必要とするチーム
  • LLMコンポーネントのないプロジェクト

制限事項

  • セルフホストにはDocker/Kubernetesのセットアップが必要
  • 比較的新しいAgentシミュレーション機能
  • Langfuse/LangSmithより小規模なコミュニティ
  • 一部の高度な機能はエンタープライズ向けのみ

langwatch の代替ツール

  • Langfuse:オブザーバビリティ、評価、プロンプトおよびデータセット管理のためのオープンソースLLMエンジニアリングプラットフォーム(3.5万スター)
  • Agenta:プロンプトプレイグラウンド、プロンプト管理、LLM 評価、LLM オブザーバビリティを1か所に統合したオープンソースの LLMOps プラットフォームです。(4,799スター)
  • Opik:包括的なトレーシング、自動評価、本番環境で利用できるダッシュボードで、LLM アプリケーション、RAG システム、Agent ワークフローをデバッグ、評価、監視します。(2.2万スター)
  • phoenix:AIオブザーバビリティと評価(1.2万スター)
  • TensorZero(1.2万スター)
  • helicone(6,190スター)

代替ツールの詳しい比較(英語)→

よくある質問

langwatch とは?
LangWatchは、LLM評価とAI Agentテスト向けに設計された包括的なプラットフォームです。開発中と本番環境の両方で、AIを活用したAgentのテスト、シミュレーション、評価、監視をエンドツーエンドで行う機能をチームに提供します。独自のツール基盤を必要とせず、回帰テストと本番環境のオブザーバビリティに対する重要なニーズに対応します。LangWatchの特徴は、ツール、状態、ユーザーシミュレーター、判定器を含むスタック全体を対象にテストする、現実的なAgentシミュレーションです。これにより、Agentがどこで、なぜ動作しなくなるのかをチームが正確に特定できるようにします。評価、オブザーバビリティ、プロンプト管理を統一されたワークフローに統合し、性能のトレース、データセットの作成、結果の評価、プロンプトとモデルの最適化、再テストをシームレスなループで行えるようにします。オープン標準に基づき、OpenTelemetry/OTLPをネイティブにサポートするLangWatchは、特定のフレームワークやLLMプロバイダーに依存せず、ベンダーロックインが生じないことを保証します。実行結果のレビュー、失敗へのアノテーション、アノテーションキューなどの機能を通じてコラボレーションを促進し、ドメインの専門家がエッジケースに効率よくラベル付けできるようにします。プロンプトのバージョン管理のためのGitHub連携と、容易に統合できるPythonおよびnpmパッケージを備えたLangWatchは、独自の評価基盤を構築する負担なしに、AI Agent向けの堅牢なテストと監視機能を必要とするチームに対応します。
langwatch は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 1,561 件、最新コミットは 2026-10-01。
langwatch の代替ツールは?
langwatch に近いオープンソースの代替ツール:Langfuse、Agenta、Opik、phoenix、TensorZero、helicone。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/langwatch/langwatch

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →