phoenix
AI 可观测性与评估
仍在活跃开发:最近 90 天有 1,200 次提交,最近一次提交在 2026-10-01。
GitHub 星数
1.2 万
近 30 天涨星
+416
近 90 天提交
1,200
近 6 个月发版
10
phoenix 是由 Arize AI 开发的 AI 可观测性和评估平台,专注于帮助开发者监控、评估和优化 AI 模型和应用程序的性能。作为一个开源工具,phoenix 为机器学习工程师和数据科学家提供了全面的观测能力,让他们能够深入了解 AI 系统的运行状况、性能指标和潜在问题。该工具在 GitHub 上获得了超过9000个星标,反映了其在 AI 社区中的受欢迎程度。phoenix 支持对 AI 模型的实时监控,帮助识别模型漂移、性能下降和数据质量问题,同时提供详细的评估指标和分析报告。通过其直观的界面和强大的分析功能,开发团队可以快速定位问题、优化模型性能,并确保 AI 应用在生产环境中的稳定运行。
和同类工具的区别
在一个开源平台中提供全栈 AI 可观测性(追踪 + 评估 + 数据集 + 提示词管理)——相比之下,LangSmith 为闭源且专用于 LangChain
主要能力
- 通过 OpenTelemetry 插桩追踪 LLM 应用
- 由 LLM 驱动的评估(响应和检索评估)
- 用于实验和微调的版本化数据集
- 跟踪涉及提示词、LLM 和检索变更的实验
- 用于模型比较和参数调优的提示词试验场
- 支持版本控制和标签的提示词管理
- 支持 MCP 服务器,用于 AI 工具集成
适合
- 调试和监控生产环境中的 LLM 应用
- 系统化的提示词工程和实验跟踪
不太适合
- 通用应用监控(非 LLM 专用)
- 不使用基于 LLM 的应用的团队
局限
- 以 Python 为中心——TypeScript 包是轻量级子包
- 云端功能需要 Arize 账户
- 评估质量取决于用于评分的 LLM
phoenix 的替代品
常见问题
- phoenix 是做什么的?
- phoenix 是由 Arize AI 开发的 AI 可观测性和评估平台,专注于帮助开发者监控、评估和优化 AI 模型和应用程序的性能。作为一个开源工具,phoenix 为机器学习工程师和数据科学家提供了全面的观测能力,让他们能够深入了解 AI 系统的运行状况、性能指标和潜在问题。该工具在 GitHub 上获得了超过9000个星标,反映了其在 AI 社区中的受欢迎程度。phoenix 支持对 AI 模型的实时监控,帮助识别模型漂移、性能下降和数据质量问题,同时提供详细的评估指标和分析报告。通过其直观的界面和强大的分析功能,开发团队可以快速定位问题、优化模型性能,并确保 AI 应用在生产环境中的稳定运行。
- phoenix 还在维护吗?
- 仍在活跃开发:最近 90 天有 1,200 次提交,最近一次提交在 2026-10-01。
- phoenix 有哪些替代品?
- 和 phoenix 最接近的开源替代品有 Langfuse、Agenta、Opik、TensorZero、Pezzo、langwatch。
星数、提交和发版数据来自 GitHub API,每天自动刷新。介绍文字由 AI 从英文翻译,并经过第二个模型的回译校对。 项目地址:github.com/Arize-ai/phoenix