产品概述
OCRmyPDF 是一款免费开源的命令行工具,专门给扫描生成的 PDF 文件添加 OCR(光学字符识别)文本层,让原本只有图片的 PDF 变得可以搜索、复制和引用。它支持超过 100 种语言,能自动优化图像(比如调整分辨率、压缩大小)、纠偏(纠正歪斜)、清洁(去除污点和噪点)以及旋转页面方向,最终生成符合 PDF/A 标准的文件。所有处理都在本地完成,不上传任何数据,确保敏感文档安全。
核心优势
- **功能全面且可定制**:不仅能加 OCR,还能一键优化图像质量,减少文件体积。支持多种高级选项,比如指定 OCR 语言(简体中文用 `chi_sim`)、调整渲染参数、控制输出 PDF/A 版本。还可以通过 API 或插件集成到自己的项目中。
- **处理高效,适合批量作业**:默认利用所有 CPU 核心并行处理,配合 GNU parallel 等工具可以批量转换大量文档。还有 Docker 镜像,方便部署在服务器或自动化流程中。
- **完全离线,数据安全**:所有计算都在本地执行,不依赖任何云端服务,非常适合处理合同、发票、档案等敏感文件。
适用场景
- **档案数字化**:图书馆、档案馆将纸质文档批量转为可搜索的电子档案。
- **学术研究**:扫描论文、书籍后快速提取文字,便于引用和分析。
- **企业文档管理**:自动转换扫描的合同、发票、报表,方便归档和检索。
- **新闻采编**:从扫描版新闻报道中提取文本,提高编辑效率。