Xberg

用于提取文本、表格、元数据、图像和结构化数据的 Rust 文档智能引擎

仍在活跃开发:最近 90 天有 3,103 次提交,最近一次提交在 2026-10-01。

GitHub 星数
9,361
近 30 天涨星
+60
近 90 天提交
3,103
近 6 个月发版
10

Xberg 可从涵盖 140 种文件扩展名的 106 种格式中提取文本、元数据、图像、表格和结构化数据。它包含面向 371 种语言的代码智能功能,并提供 15 种语言绑定、CLI、REST API 和 MCP 服务器。

和同类工具的区别

单一引擎即可处理 107 种格式的格式检测、读取、OCR 和提取,无需组装流水线。

主要能力

  • 从 107 种格式中提取文本/元数据/图像/表格
  • 支持多种后端的按需 OCR
  • 音频/视频转录
  • 面向 371 种语言的代码智能
  • 嵌入与搜索
  • MCP 服务器集成

适合

  • 需要结构化文档提取的 Agent 流水线
  • 需要提取干净文本和表格的 RAG 系统
  • 面向 AI Agent 的多格式数据摄取

不太适合

  • 面向终端用户的聊天机器人界面
  • 通用 AI 内容生成
  • 图像生成应用

局限

  • URL 摄取等部分能力需要特定功能支持

Xberg 的替代品

查看完整替代品对比(英文)→

常见问题

Xberg 是做什么的?
Xberg 可从涵盖 140 种文件扩展名的 106 种格式中提取文本、元数据、图像、表格和结构化数据。它包含面向 371 种语言的代码智能功能,并提供 15 种语言绑定、CLI、REST API 和 MCP 服务器。
Xberg 还在维护吗?
仍在活跃开发:最近 90 天有 3,103 次提交,最近一次提交在 2026-10-01。
Xberg 有哪些替代品?
和 Xberg 最接近的开源替代品有 unstructured、Docling、MegaParse、text-extract-api、MarkItDown、olmocr。
Xberg 是开源的吗?
是的,Xberg 是开源项目,代码托管在 GitHub 上。

星数、提交和发版数据来自 GitHub API,每天自动刷新。介绍文字由 AI 从英文翻译,并经过第二个模型的回译校对。 项目地址:github.com/xberg-io/xberg

你也在做 AI Agent 工具?

可以免费提交收录,也可以付费加急审核。

提交你的工具 →