Langfuse

オブザーバビリティ、評価、プロンプトおよびデータセット管理のためのオープンソースLLMエンジニアリングプラットフォーム

現在も活発に開発中:直近 90 日間のコミットは 2,011 件、最新コミットは 2026-10-01。

GitHub スター
3.5万
直近 30 日のスター増加
+1,816
直近 90 日のコミット
2,011
直近 6 か月のリリース
10

Langfuseは、開発者による言語モデルアプリケーションの監視、評価、改善を支援するために設計されたオープンソースのLLMエンジニアリングプラットフォームです。Y Combinator W23の企業であり、GitHubで23,000を超えるスターを獲得しており、メトリクス、トレース、分析を通じてLLMの使用状況に関する包括的なオブザーバビリティを提供します。プロンプトのバージョン管理とテストのためのプロンプト管理、モデルの性能を測定する評価機能、実験用の対話型プレイグラウンド、学習データとテストデータを整理するデータセット管理を含む、一式のツールを提供します。Langfuseは、OpenTelemetry、LangChain、OpenAI SDK、LiteLLMなどの広く使われているLLMフレームワークやツールとシームレスに統合でき、既存のワークフローに容易に追加できます。クラウドサービスとセルフホストの両方で利用でき、エンジニアリングチームによる本番LLMアプリケーションの問題のデバッグ、コストの最適化、品質の確保を支援します。モデルの挙動の理解、経時的な性能の追跡、大規模なプロンプト管理が成功に不可欠な、複雑なAIアプリケーションを構築するチームにとって特に有用です。

他ツールとの違い

LangSmith(LangChain専用)やHelicone(プロキシベース)とは異なり、Langfuseは完全にオープンソースで、フレームワークに依存せず、セルフホストが可能です。スケーラブルな本番運用に向けてClickHouse上に構築された単一のプラットフォームに、トレーシング、プロンプト管理、評価、データセットを統合しています。

主な機能

  • LLM呼び出し、検索、埋め込み、Agentのアクションのトレーシングによる、LLMアプリケーションのエンドツーエンドのオブザーバビリティ
  • バージョン管理、共同編集、強力なクライアント/サーバーキャッシュを備えた一元的なプロンプト管理
  • LLM-as-a-judgeによる評価、ユーザーフィードバックの収集、手動ラベリング、カスタム評価パイプライン
  • デプロイ前のテストワークフローを備えた、テストセットとベンチマークのデータセット管理
  • トレースからプレイグラウンドへ直接移動できる、プロンプトの反復改善のための対話型LLM Playground
  • OpenAPI仕様、Postmanコレクション、PythonおよびJS/TS向けの型付きSDKを備えた包括的なREST API

向いている用途

  • 本番LLMアプリケーションを運用し、トレーシング、プロンプト管理、評価を単一のプラットフォームで必要とするチーム
  • データプライバシー要件への準拠のためにセルフホストのLLMオブザーバビリティを必要とする組織

向いていない用途

  • シンプルなチャットボットを構築する個人開発者 — オブザーバビリティ基盤のオーバーヘッドは不要なため、代わりにPydantic AI組み込みのLogfireを使用
  • Agentフレームワークを探しているチーム — 構築にはLangChainまたはCrewAIを使用し、その後、監視用にLangfuseを接続

制限事項

  • オブザーバビリティに重点 — それ自体はAgentやチェーンを構築するためのフレームワークではない
  • セルフホストでのデプロイにはClickHouse + Postgresの基盤が必要
  • 評価機能には判定用プロンプトと採点基準の手動設定が必要

Langfuse の代替ツール

  • phoenix:AIオブザーバビリティと評価(1.2万スター)
  • Agenta:プロンプトプレイグラウンド、プロンプト管理、LLM 評価、LLM オブザーバビリティを1か所に統合したオープンソースの LLMOps プラットフォームです。(4,799スター)
  • OpenLIT(2,809スター)
  • helicone(6,190スター)
  • Opik:包括的なトレーシング、自動評価、本番環境で利用できるダッシュボードで、LLM アプリケーション、RAG システム、Agent ワークフローをデバッグ、評価、監視します。(2.2万スター)
  • TensorZero(1.2万スター)

代替ツールの詳しい比較(英語)→

よくある質問

Langfuse とは?
Langfuseは、開発者による言語モデルアプリケーションの監視、評価、改善を支援するために設計されたオープンソースのLLMエンジニアリングプラットフォームです。Y Combinator W23の企業であり、GitHubで23,000を超えるスターを獲得しており、メトリクス、トレース、分析を通じてLLMの使用状況に関する包括的なオブザーバビリティを提供します。プロンプトのバージョン管理とテストのためのプロンプト管理、モデルの性能を測定する評価機能、実験用の対話型プレイグラウンド、学習データとテストデータを整理するデータセット管理を含む、一式のツールを提供します。Langfuseは、OpenTelemetry、LangChain、OpenAI SDK、LiteLLMなどの広く使われているLLMフレームワークやツールとシームレスに統合でき、既存のワークフローに容易に追加できます。クラウドサービスとセルフホストの両方で利用でき、エンジニアリングチームによる本番LLMアプリケーションの問題のデバッグ、コストの最適化、品質の確保を支援します。モデルの挙動の理解、経時的な性能の追跡、大規模なプロンプト管理が成功に不可欠な、複雑なAIアプリケーションを構築するチームにとって特に有用です。
Langfuse は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 2,011 件、最新コミットは 2026-10-01。
Langfuse の代替ツールは?
Langfuse に近いオープンソースの代替ツール:phoenix、Agenta、OpenLIT、helicone、Opik、TensorZero。
Langfuse はオープンソースですか?
はい。Langfuse はオープンソースで、コードは GitHub で公開されています。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/langfuse/langfuse

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →