Xberg
用于提取文本、表格、元数据、图像和结构化数据的 Rust 文档智能引擎
仍在活跃开发:最近 90 天有 3,103 次提交,最近一次提交在 2026-10-01。
GitHub 星数
9,361
近 30 天涨星
+60
近 90 天提交
3,103
近 6 个月发版
10
Xberg 可从涵盖 140 种文件扩展名的 106 种格式中提取文本、元数据、图像、表格和结构化数据。它包含面向 371 种语言的代码智能功能,并提供 15 种语言绑定、CLI、REST API 和 MCP 服务器。
和同类工具的区别
单一引擎即可处理 107 种格式的格式检测、读取、OCR 和提取,无需组装流水线。
主要能力
- 从 107 种格式中提取文本/元数据/图像/表格
- 支持多种后端的按需 OCR
- 音频/视频转录
- 面向 371 种语言的代码智能
- 嵌入与搜索
- MCP 服务器集成
适合
- 需要结构化文档提取的 Agent 流水线
- 需要提取干净文本和表格的 RAG 系统
- 面向 AI Agent 的多格式数据摄取
不太适合
- 面向终端用户的聊天机器人界面
- 通用 AI 内容生成
- 图像生成应用
局限
- URL 摄取等部分能力需要特定功能支持
Xberg 的替代品
- unstructured(1.6 万星)
- Docling:为生成式 AI 准备好文档(6.8 万星)
- MegaParse(7,414星)
- text-extract-api(3,182星)
- MarkItDown:用于将文件和办公文档转换为 Markdown 的 Python 工具。(18.8 万星)
- olmocr(2 万星)
常见问题
- Xberg 是做什么的?
- Xberg 可从涵盖 140 种文件扩展名的 106 种格式中提取文本、元数据、图像、表格和结构化数据。它包含面向 371 种语言的代码智能功能,并提供 15 种语言绑定、CLI、REST API 和 MCP 服务器。
- Xberg 还在维护吗?
- 仍在活跃开发:最近 90 天有 3,103 次提交,最近一次提交在 2026-10-01。
- Xberg 有哪些替代品?
- 和 Xberg 最接近的开源替代品有 unstructured、Docling、MegaParse、text-extract-api、MarkItDown、olmocr。
- Xberg 是开源的吗?
- 是的,Xberg 是开源项目,代码托管在 GitHub 上。
星数、提交和发版数据来自 GitHub API,每天自动刷新。介绍文字由 AI 从英文翻译,并经过第二个模型的回译校对。 项目地址:github.com/xberg-io/xberg