langwatch
LLM評価とAI Agentテストのためのプラットフォーム
現在も活発に開発中:直近 90 日間のコミットは 1,561 件、最新コミットは 2026-10-01。
LangWatchは、LLM評価とAI Agentテスト向けに設計された包括的なプラットフォームです。開発中と本番環境の両方で、AIを活用したAgentのテスト、シミュレーション、評価、監視をエンドツーエンドで行う機能をチームに提供します。独自のツール基盤を必要とせず、回帰テストと本番環境のオブザーバビリティに対する重要なニーズに対応します。LangWatchの特徴は、ツール、状態、ユーザーシミュレーター、判定器を含むスタック全体を対象にテストする、現実的なAgentシミュレーションです。これにより、Agentがどこで、なぜ動作しなくなるのかをチームが正確に特定できるようにします。評価、オブザーバビリティ、プロンプト管理を統一されたワークフローに統合し、性能のトレース、データセットの作成、結果の評価、プロンプトとモデルの最適化、再テストをシームレスなループで行えるようにします。オープン標準に基づき、OpenTelemetry/OTLPをネイティブにサポートするLangWatchは、特定のフレームワークやLLMプロバイダーに依存せず、ベンダーロックインが生じないことを保証します。実行結果のレビュー、失敗へのアノテーション、アノテーションキューなどの機能を通じてコラボレーションを促進し、ドメインの専門家がエッジケースに効率よくラベル付けできるようにします。プロンプトのバージョン管理のためのGitHub連携と、容易に統合できるPythonおよびnpmパッケージを備えたLangWatchは、独自の評価基盤を構築する負担なしに、AI Agent向けの堅牢なテストと監視機能を必要とするチームに対応します。
他ツールとの違い
Agentシミュレーション、評価、オブザーバビリティ、プロンプト最適化を組み合わせた、OpenTelemetryネイティブ設計の統合プラットフォーム — トレース(Langfuse)、評価(DeepEval)、プロンプト管理に個別のツールを使う構成との違い
主な機能
- エンドツーエンドのAgentシミュレーションテスト
- LLMのトレースとオブザーバビリティ(OpenTelemetryネイティブ)
- LLM判定器によるオフラインおよびオンライン評価
- GitHub連携によるプロンプト管理
- プロンプトとモデルの最適化スタジオ
- 人手によるラベル付けのためのアノテーションワークフロー
- コストと性能の監視
向いている用途
- 評価 + オブザーバビリティ + プロンプト管理を1つのツールで行いたいチーム
- 本番デプロイ前のAgentシミュレーションテスト
- OpenTelemetryネイティブのLLMオブザーバビリティを必要とする組織
向いていない用途
- 評価なしの単純なログ記録のみを必要とするチーム
- LLMコンポーネントのないプロジェクト
制限事項
- セルフホストにはDocker/Kubernetesのセットアップが必要
- 比較的新しいAgentシミュレーション機能
- Langfuse/LangSmithより小規模なコミュニティ
- 一部の高度な機能はエンタープライズ向けのみ
langwatch の代替ツール
- Langfuse:オブザーバビリティ、評価、プロンプトおよびデータセット管理のためのオープンソースLLMエンジニアリングプラットフォーム(3.5万スター)
- Agenta:プロンプトプレイグラウンド、プロンプト管理、LLM 評価、LLM オブザーバビリティを1か所に統合したオープンソースの LLMOps プラットフォームです。(4,799スター)
- Opik:包括的なトレーシング、自動評価、本番環境で利用できるダッシュボードで、LLM アプリケーション、RAG システム、Agent ワークフローをデバッグ、評価、監視します。(2.2万スター)
- phoenix:AIオブザーバビリティと評価(1.2万スター)
- TensorZero(1.2万スター)
- helicone(6,190スター)
よくある質問
- langwatch とは?
- LangWatchは、LLM評価とAI Agentテスト向けに設計された包括的なプラットフォームです。開発中と本番環境の両方で、AIを活用したAgentのテスト、シミュレーション、評価、監視をエンドツーエンドで行う機能をチームに提供します。独自のツール基盤を必要とせず、回帰テストと本番環境のオブザーバビリティに対する重要なニーズに対応します。LangWatchの特徴は、ツール、状態、ユーザーシミュレーター、判定器を含むスタック全体を対象にテストする、現実的なAgentシミュレーションです。これにより、Agentがどこで、なぜ動作しなくなるのかをチームが正確に特定できるようにします。評価、オブザーバビリティ、プロンプト管理を統一されたワークフローに統合し、性能のトレース、データセットの作成、結果の評価、プロンプトとモデルの最適化、再テストをシームレスなループで行えるようにします。オープン標準に基づき、OpenTelemetry/OTLPをネイティブにサポートするLangWatchは、特定のフレームワークやLLMプロバイダーに依存せず、ベンダーロックインが生じないことを保証します。実行結果のレビュー、失敗へのアノテーション、アノテーションキューなどの機能を通じてコラボレーションを促進し、ドメインの専門家がエッジケースに効率よくラベル付けできるようにします。プロンプトのバージョン管理のためのGitHub連携と、容易に統合できるPythonおよびnpmパッケージを備えたLangWatchは、独自の評価基盤を構築する負担なしに、AI Agent向けの堅牢なテストと監視機能を必要とするチームに対応します。
- langwatch は現在もメンテナンスされていますか?
- 現在も活発に開発中:直近 90 日間のコミットは 1,561 件、最新コミットは 2026-10-01。
- langwatch の代替ツールは?
- langwatch に近いオープンソースの代替ツール:Langfuse、Agenta、Opik、phoenix、TensorZero、helicone。
スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/langwatch/langwatch