ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

OCRmyPDF 免费 OCR 入门:3 条命令把扫描 PDF 变成可搜索文档

OCRmyPDF 免费 OCR 入门:3 条命令把扫描 PDF 变成可搜索文档 OCRmyPDF 免费 OCR 入门3 条命令把扫描 PDF 变成可搜索文档【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是开源免费的命令行 OCR 工具跑完拿到的还是同一份文件只是每页下面多了一层可搜索、可复制的隐藏文本识别由 Tesseract 引擎完成全程本地离线批量处理不花一分钱。扫描 PDF 怎么变成可搜索文档先建立正确预期用 OCRmyPDF 之前先把三件事想清楚它替你做什么逐页读取图像交给 Tesseract一个开源识别引擎转成文字再把文字以不可见的方式垫在图像下面。原始页面一个像素都不改你得到的是看起来没变、但能搜了的文档。输出默认是 PDF/A 归档格式一种适合长期保存的 PDF 标准。它不碰什么文件不上云、不经过任何服务器不重压缩图像画质与原始嵌入一致不联网检查断网照跑。最适合谁手里有一堆扫描版 PDF论文、票据、老合同需要归档和检索的人。单页试一次、上百页批一次都合适。安装与首跑从装好到出结果三大平台各一条安装命令装完即可使用pip install ocrmypdf # Windows brew install ocrmypdf # macOS apt install ocrmypdf # Debian / UbuntuWindows 上还需要额外装好 Tesseract 与 Ghostscript 两个依赖具体步骤见安装说明。下面这张图就是典型输入整页扫描的文档只有图像没有文字正是 OCRmyPDF 要处理的对象。装完直接跑最小命令一条搞定ocrmypdf 扫描.pdf 输出.pdf10 秒验证用 PDF 阅读器打开输出文件CtrlF搜一个词能命中、能选中复制文本层就算加上了。用法三个真实场景中英混排文档的 OCR 语言怎么指定默认按英文识别中英混排的文档要先告诉它语言否则中文基本认不出来ocrmypdf --language chi_simeng 文档.pdf 输出.pdf--language支持 100 多种语言代码用拼接即同时识别多种缺语言包时按排错节的办法补装。一批扫描件的批量 OCR 命令页数一多单核跑太慢。--jobs把页面分给多个 CPU 核心并行处理4 核机器写 4多个文件就循环执行同一命令一次排队处理完ocrmypdf --jobs 4 大文件.pdf 输出.pdf晚上挂机跑整批票据、论文正合适。歪斜脏污的扫描件先摆正再识别扫描件常见整页倾斜、阴影噪点。两个预处理开关让图像先整理再进识别准确率比直接识别高一截ocrmypdf --deskew --clean-final 歪斜.pdf 输出.pdf--deskew校正页面倾斜角--clean-final调用 unpaper一个开源去噪预处理程序去阴影和杂点。报错速查四个高频问题问提示缺少某个语言怎么办原因对应的 Tesseract 语言包没装。一条命令补上以中文简体为例apt-get install tesseract-ocr-chi-sim。问大文件处理到一半内存不足原因整份文件一次载入。用--pages只处理指定页码段分段跑ocrmypdf --pages 1-50 大文件.pdf 部分1.pdf。问提示 page already has text 拒绝处理原因文件里已有文本可能是以前失败的 OCR 残留。加--force-ocr强制重扫或加--skip-text跳过已有文本的页面。问处理速度偏慢原因并行数没开。按 CPU 核心数加--jobs见上文批量场景的命令。全部参数以官方文档为准想定制识别流程可以看内置插件源码里 Ghostscript 优化、Tesseract 调度等实现。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表