ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

OCRmyPDF:3 分钟给扫描版 PDF 加上可搜索的 OCR 文本层

OCRmyPDF:3 分钟给扫描版 PDF 加上可搜索的 OCR 文本层 OCRmyPDF3 分钟给扫描版 PDF 加上可搜索的 OCR 文本层【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描版 PDF 为什么搜不到OCRmyPDF 怎么补文本层你手上有几份扫描出来的 PDF——合同、旧论文、票据。打开一份CtrlF 敲个关键词毫无反应。原因很简单这种 PDF 的页面只是一张图片底下没有文字可供搜索和复制。OCRmyPDF 就是专门给这类扫描 PDF 补上一层 OCR 文本层的命令行工具它保留原来的图像在图像下方精确排上可复制、可搜索的文字默认再输出 PDF/A 归档格式。OCR 文本层、PDF/A 归档与多语言它解决了什么 把纯图片页面变成能搜、能复制文字层贴合图像位置复制出来的段落不会错位、不会串行。 默认产出 PDF/A-2b 归档格式并通过验证图像优化后输出文件常常比输入还小。 走 Tesseract 引擎支持 100 多种语言-l chi_sim中文简体、-l engfra中英混排都能处理。⚡ 默认用满所有 CPU 核心能扛住几千页的大文件数据本地处理不上传。从安装到跑通第一条 OCR 命令如果你用的是 Debian/Ubuntu、macOS 或常见 Linux那么用系统包管理器一条命令装好即可apt install ocrmypdf # Debian / Ubuntu brew install ocrmypdf # macOS / Linux pip install ocrmypdf # 其它平台uv、pipx 同理跑ocrmypdf --version行内命令能打印出版本号说明装好了。如果你要识别的是中文或中英混排文档那么先确认装了 Tesseract 对应的语言包再带上-l参数执行核心命令ocrmypdf --deskew -l chi_sim 扫描件.pdf 可搜索.pdf--deskew会顺手把歪掉的页面扶正。做完后你会看到输出一个新的 .pdf打开能直接选中文字、CtrlF 搜到关键词。如果你有一整批 PDF那么不要逐个手敲改用 GNU Parallel 起并行方法见 docs/batch.md。轻度、重度与 macOS 用户各自怎么选轻度用户 / 偶尔扫描几份默认参数跑ocrmypdf 输入.pdf 输出.pdf就够别折腾一堆 flag。理由它默认已经是合理配置PDF/A 优化 全核心。重度用户 / 批量归档重点调-l语言、--deskew --clean图像预处理、--optimize压缩级别并用 GNU Parallel 并行。理由扫描件质量参差预处理能明显提升识别率。macOS 用户用系统快捷指令/自动化把它接进工作流选中 PDF 自动批量处理。理由不用切终端拖文件即触发。中文乱码、文件变大、识别率低的排查链遇到中文识别成乱码或方框 → 先查-l是否写成了chi_sim、语言包是否真装了 → 还不行就装对应 tesseract 语言包再重跑。遇到输出比输入还大 → 先查是否开了--output-type pdfaPDF/A 要内嵌资源天然更大→ 想更小就改用--output-type pdf或把--optimize提到 2/3。遇到页面是斜的、识别率偏低 → 先加--deskew扶正 → 扫描本身太脏就再加--clean需装 unpaper。遇到提示缺少 Ghostscript / Tesseract → 先查依赖是否装全见 docs/installation.md→ 17 版起 Ghostscript 也可由 pypdfium2 替代按其指引补装。定位与下一步跑通一次或读文档OCRmyPDF 是一个本地运行、把扫描 PDF 变成可搜索可归档 PDF/A 的命令行工具装好一条命令即可用。接下来你可以跑一次ocrmypdf 输入.pdf 输出.pdf或打开下面两篇延伸阅读docs/introduction.md 讲它为什么不建议手动拼接图像docs/installation.md 给各平台完整安装步骤。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表