MinerU
将 PDF 等复杂文档转换为 LLM 可处理的 markdown/JSON,用于 Agent 工作流。
仍在活跃开发:最近 90 天有 911 次提交,最近一次提交在 2026-09-29。
GitHub 星数
8.1 万
近 30 天涨星
+3,758
近 90 天提交
911
近 6 个月发版
10
MinerU 是一个专为 AI Agent 工作流设计的文档处理工具,能够将复杂的 PDF 和其他文档格式转换为 LLM 可处理的 Markdown 和 JSON 格式。该工具通过智能解析技术,保持文档的结构完整性和内容准确性,特别适合需要大规模文档处理的 AI 应用场景。MinerU 提供了 Python SDK 和在线 Web 应用两种使用方式,满足不同开发者的需求。其强大的文档理解能力使得原本非结构化的 PDF 内容可以被 AI 模型有效利用,大大提升了文档驱动的 AI 应用的数据质量。凭借超过 57,000 个 GitHub 星标,MinerU 已成为文档预处理领域的热门选择,被广泛应用于知识库构建、RAG 系统和智能文档分析等场景。工具支持批量处理,能够高效处理大量文档,为企业级 AI 应用提供可靠的文档转换基础设施。
和同类工具的区别
与 PyPDF(仅提取文本)或云端 OCR 服务不同,MinerU 可保留文档布局,包括嵌有公式的表格,并在 OmniDocBench 上获得 86.2 分——专为 AI/RAG 文档处理流水线构建
主要能力
- 高精度 PDF/文档解析,支持布局检测和公式识别
- 原生 DOCX 解析,相比转换为 PDF 的方式,端到端速度提升 10x+
- 表格解析,包括表格单元格内的图像/公式
- 印章文字识别、竖排文本支持及行间公式编号
- 在文档理解基准测试 OmniDocBench 上获得 86.2 分
- 通过 mineru.net 使用 Web 应用、桌面客户端和 API
适合
- 需要高保真提取 PDF/DOCX 并保留表格、公式和布局的 RAG 流水线
- 处理含有复杂数学符号的科学论文的学术和研究团队
不太适合
- 从规整文档中提取简单文本——请改用 PyPDF 或 pdfplumber
- 对图像进行实时 OCR——请使用 Tesseract 或云端视觉 API
局限
- 建议使用 GPU 以加快处理速度——仅使用 CPU 的模式明显更慢
- 仅专注文档提取——并非通用 OCR 工具
- AGPL 类许可证可能限制商业使用
MinerU 的替代品
- Docling:为生成式 AI 准备好文档(6.8 万星)
- unstructured(1.6 万星)
- LLM Sherpa(1,753星)
- MarkItDown:用于将文件和办公文档转换为 Markdown 的 Python 工具。(18.8 万星)
- olmocr(2 万星)
- text-extract-api(3,182星)
常见问题
- MinerU 是做什么的?
- MinerU 是一个专为 AI Agent 工作流设计的文档处理工具,能够将复杂的 PDF 和其他文档格式转换为 LLM 可处理的 Markdown 和 JSON 格式。该工具通过智能解析技术,保持文档的结构完整性和内容准确性,特别适合需要大规模文档处理的 AI 应用场景。MinerU 提供了 Python SDK 和在线 Web 应用两种使用方式,满足不同开发者的需求。其强大的文档理解能力使得原本非结构化的 PDF 内容可以被 AI 模型有效利用,大大提升了文档驱动的 AI 应用的数据质量。凭借超过 57,000 个 GitHub 星标,MinerU 已成为文档预处理领域的热门选择,被广泛应用于知识库构建、RAG 系统和智能文档分析等场景。工具支持批量处理,能够高效处理大量文档,为企业级 AI 应用提供可靠的文档转换基础设施。
- MinerU 还在维护吗?
- 仍在活跃开发:最近 90 天有 911 次提交,最近一次提交在 2026-09-29。
- MinerU 有哪些替代品?
- 和 MinerU 最接近的开源替代品有 Docling、unstructured、LLM Sherpa、MarkItDown、olmocr、text-extract-api。
星数、提交和发版数据来自 GitHub API,每天自动刷新。介绍文字由 AI 从英文翻译,并经过第二个模型的回译校对。 项目地址:github.com/opendatalab/MinerU