产品概述
MinerU由上海人工智能实验室OpenDataLab团队开发,最初用于书生·浦语大模型的预训练数据预处理。它专注于将PDF、网页和电子书等非结构化文档转换为机器可读的Markdown、JSON等格式,最大程度保留原文的布局和语义结构。无论是扫描版PDF、乱码PDF还是复杂多栏排版,MinerU都能智能识别并提取文字、图片、表格、公式,同时自动去除页眉、页脚、页码等干扰元素,输出符合人类阅读顺序的纯净文本。
核心优势
- **精准文档解析**:支持单栏、多栏及复杂排版的版面分析,能自动识别标题、段落、列表、图片与表格,并保留其层级关系。遇到扫描件或乱码PDF会自动启用OCR(支持84种语言),确保信息不丢失。
- **多模态内容处理**:不仅提取文本,还能把公式转为LaTeX格式、表格转为HTML格式,并输出图片及描述。这些多模态信息可以用于大模型训练、知识图谱构建或科研数据准备。
- **灵活部署与输出**:提供Magic-PDF和Magic-Doc两个子模块,分别专注PDF和网页/电子书。支持CPU和GPU,兼容Windows、Linux、Mac。输出格式包括可读性强的Markdown、按阅读顺序排序的JSON,以及带layout/span可视化的中间格式,方便后续质检和二次开发。
适用场景
- 学术研究:批量提取论文中的公式、表格和图表,加速文献综述和数据整理
- 市场分析:从行业报告、财报PDF中提取关键数据和图表,构建结构化数据库
- 法律文档处理:自动去除页眉页脚,保留条款层级,便于法律检索和合同比对
- 大模型训练数据准备:将海量PDF、网页转为干净文本,为预训练或微调提供高质量语料
- 知识管理:个人或企业将电子书、文档库统一转换为Markdown,方便后续索引和问答