MinerU

一个能把PDF、网页和电子书转成Markdown、JSON等格式的开源工具,保留原排版,自动识别公式、表格和图片,支持84种语言OCR。

Github 🆓 免费 🔓 开源
✨ 保留原始排版,智能去除非正文元素✨ 公式LaTeX化、表格HTML化,多模态输出✨ 自动OCR识别84种语言✨ 支持CPU/GPU,跨平台运行✨ 开源免费,GitHub热门项目
🌐 访问官网 →

产品概述

MinerU由上海人工智能实验室OpenDataLab团队开发,最初用于书生·浦语大模型的预训练数据预处理。它专注于将PDF、网页和电子书等非结构化文档转换为机器可读的Markdown、JSON等格式,最大程度保留原文的布局和语义结构。无论是扫描版PDF、乱码PDF还是复杂多栏排版,MinerU都能智能识别并提取文字、图片、表格、公式,同时自动去除页眉、页脚、页码等干扰元素,输出符合人类阅读顺序的纯净文本。

核心优势