phoenix

AI 可观测性与评估

仍在活跃开发:最近 90 天有 1,200 次提交,最近一次提交在 2026-10-01。

GitHub 星数
1.2 万
近 30 天涨星
+416
近 90 天提交
1,200
近 6 个月发版
10

phoenix 是由 Arize AI 开发的 AI 可观测性和评估平台,专注于帮助开发者监控、评估和优化 AI 模型和应用程序的性能。作为一个开源工具,phoenix 为机器学习工程师和数据科学家提供了全面的观测能力,让他们能够深入了解 AI 系统的运行状况、性能指标和潜在问题。该工具在 GitHub 上获得了超过9000个星标,反映了其在 AI 社区中的受欢迎程度。phoenix 支持对 AI 模型的实时监控,帮助识别模型漂移、性能下降和数据质量问题,同时提供详细的评估指标和分析报告。通过其直观的界面和强大的分析功能,开发团队可以快速定位问题、优化模型性能,并确保 AI 应用在生产环境中的稳定运行。

和同类工具的区别

在一个开源平台中提供全栈 AI 可观测性(追踪 + 评估 + 数据集 + 提示词管理)——相比之下,LangSmith 为闭源且专用于 LangChain

主要能力

  • 通过 OpenTelemetry 插桩追踪 LLM 应用
  • 由 LLM 驱动的评估(响应和检索评估)
  • 用于实验和微调的版本化数据集
  • 跟踪涉及提示词、LLM 和检索变更的实验
  • 用于模型比较和参数调优的提示词试验场
  • 支持版本控制和标签的提示词管理
  • 支持 MCP 服务器,用于 AI 工具集成

适合

  • 调试和监控生产环境中的 LLM 应用
  • 系统化的提示词工程和实验跟踪

不太适合

  • 通用应用监控(非 LLM 专用)
  • 不使用基于 LLM 的应用的团队

局限

  • 以 Python 为中心——TypeScript 包是轻量级子包
  • 云端功能需要 Arize 账户
  • 评估质量取决于用于评分的 LLM

phoenix 的替代品

  • Langfuse:用于可观测性、评估、提示词和数据集管理的开源 LLM 工程平台(3.5 万星)
  • Agenta:开源 LLMOps 平台:集提示词实验场、提示词管理、LLM 评估和 LLM 可观测性于一体。(4,799星)
  • Opik:通过全面的链路追踪、自动化评估和生产就绪的仪表板,调试、评估和监控你的 LLM 应用、RAG 系统和 Agent 工作流。(2.2 万星)
  • TensorZero(1.2 万星)
  • Pezzo(3,277星)
  • langwatch:用于 LLM 评估和 AI Agent 测试的平台(4,894星)

查看完整替代品对比(英文)→

常见问题

phoenix 是做什么的?
phoenix 是由 Arize AI 开发的 AI 可观测性和评估平台,专注于帮助开发者监控、评估和优化 AI 模型和应用程序的性能。作为一个开源工具,phoenix 为机器学习工程师和数据科学家提供了全面的观测能力,让他们能够深入了解 AI 系统的运行状况、性能指标和潜在问题。该工具在 GitHub 上获得了超过9000个星标,反映了其在 AI 社区中的受欢迎程度。phoenix 支持对 AI 模型的实时监控,帮助识别模型漂移、性能下降和数据质量问题,同时提供详细的评估指标和分析报告。通过其直观的界面和强大的分析功能,开发团队可以快速定位问题、优化模型性能,并确保 AI 应用在生产环境中的稳定运行。
phoenix 还在维护吗?
仍在活跃开发:最近 90 天有 1,200 次提交,最近一次提交在 2026-10-01。
phoenix 有哪些替代品?
和 phoenix 最接近的开源替代品有 Langfuse、Agenta、Opik、TensorZero、Pezzo、langwatch。

星数、提交和发版数据来自 GitHub API,每天自动刷新。介绍文字由 AI 从英文翻译,并经过第二个模型的回译校对。 项目地址:github.com/Arize-ai/phoenix

你也在做 AI Agent 工具?

可以免费提交收录,也可以付费加急审核。

提交你的工具 →