Langfuse
用于可观测性、评估、提示词和数据集管理的开源 LLM 工程平台
仍在活跃开发:最近 90 天有 2,011 次提交,最近一次提交在 2026-10-01。
GitHub 星数
3.5 万
近 30 天涨星
+1,816
近 90 天提交
2,011
近 6 个月发版
10
Langfuse 是一个开源 LLM 工程平台,旨在帮助开发者监控、评估和改进语言模型应用。作为一家 Y Combinator W23 公司,其项目拥有超过 23,000 个 GitHub 星标,通过指标、追踪和分析提供全面的 LLM 使用可观测性。该平台提供完整的工具集,包括用于提示词版本管理和测试的提示词管理功能、用于衡量模型性能的评估功能、用于实验的交互式试验场,以及用于组织训练和测试数据的数据集管理功能。Langfuse 与常用的 LLM 框架和工具无缝集成,包括 OpenTelemetry、LangChain、OpenAI SDK 和 LiteLLM,便于接入现有工作流。它既提供云服务,也提供自托管方案,帮助工程团队调试问题、优化成本并确保生产环境中 LLM 应用的质量。对于构建复杂 AI 应用的团队,该平台尤其有价值,因为理解模型行为、持续跟踪性能以及大规模管理提示词对这些团队的成功至关重要。
和同类工具的区别
与 LangSmith(专用于 LangChain)或 Helicone(基于代理)不同,Langfuse 完全开源、不依赖特定框架且可自托管,将追踪、提示词管理、评估和数据集整合到一个基于 ClickHouse 构建的平台中,以支持可扩展的生产环境使用。
主要能力
- 端到端 LLM 应用可观测性,可追踪 LLM 调用、检索、嵌入和 Agent 操作
- 集中式提示词管理,支持版本控制、协作编辑和强大的客户端/服务器端缓存
- 以 LLM 作为评判者的评估、用户反馈收集、人工标注和自定义评估流水线
- 用于测试集和基准测试的数据集管理,配备部署前测试工作流
- 用于提示词迭代的交互式 LLM Playground,支持从追踪直接跳转到试验场
- 全面的 REST API,提供 OpenAPI 规范、Postman 集合,以及适用于 Python 和 JS/TS 的带类型 SDK
适合
- 在生产环境中运行 LLM 应用,需要在同一平台中使用追踪、提示词管理和评估功能的团队
- 为满足数据隐私合规要求而需要自托管 LLM 可观测性的组织
不太适合
- 构建简单聊天机器人的独立开发者——可观测性基础设施的开销没有必要;请改用 Pydantic AI 内置的 Logfire
- 寻找 Agent 框架的团队——请使用 LangChain 或 CrewAI 进行构建,再接入 Langfuse 进行监控
局限
- 专注于可观测性——本身不是用于构建 Agent 或链的框架
- 自托管部署需要 ClickHouse + Postgres 基础设施
- 评估功能需要手动配置评判提示词和评分标准
Langfuse 的替代品
常见问题
- Langfuse 是做什么的?
- Langfuse 是一个开源 LLM 工程平台,旨在帮助开发者监控、评估和改进语言模型应用。作为一家 Y Combinator W23 公司,其项目拥有超过 23,000 个 GitHub 星标,通过指标、追踪和分析提供全面的 LLM 使用可观测性。该平台提供完整的工具集,包括用于提示词版本管理和测试的提示词管理功能、用于衡量模型性能的评估功能、用于实验的交互式试验场,以及用于组织训练和测试数据的数据集管理功能。Langfuse 与常用的 LLM 框架和工具无缝集成,包括 OpenTelemetry、LangChain、OpenAI SDK 和 LiteLLM,便于接入现有工作流。它既提供云服务,也提供自托管方案,帮助工程团队调试问题、优化成本并确保生产环境中 LLM 应用的质量。对于构建复杂 AI 应用的团队,该平台尤其有价值,因为理解模型行为、持续跟踪性能以及大规模管理提示词对这些团队的成功至关重要。
- Langfuse 还在维护吗?
- 仍在活跃开发:最近 90 天有 2,011 次提交,最近一次提交在 2026-10-01。
- Langfuse 有哪些替代品?
- 和 Langfuse 最接近的开源替代品有 phoenix、Agenta、OpenLIT、helicone、Opik、TensorZero。
- Langfuse 是开源的吗?
- 是的,Langfuse 是开源项目,代码托管在 GitHub 上。
星数、提交和发版数据来自 GitHub API,每天自动刷新。介绍文字由 AI 从英文翻译,并经过第二个模型的回译校对。 项目地址:github.com/langfuse/langfuse