ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

离线OCR实测:Umi-OCR 一次解决截图、批量图片、扫描PDF三个难题

离线OCR实测:Umi-OCR 一次解决截图、批量图片、扫描PDF三个难题 离线OCR实测Umi-OCR 一次解决截图、批量图片、扫描PDF三个难题【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上个月帮朋友整理一批纸质档案的扫描件600 多页 PDF 既不能复制文字也无法全文搜索一页页对照核对几乎让人崩溃。那段时间我自己的麻烦也没断过网页文章右键复制被禁、老师发的教材截图想摘录只能手打、手机里攒了几百张聊天记录截图要归档。三个难题指向同一个答案——免费开源的离线OCR软件 Umi-OCR解压即用、断网也能跑、识别引擎全部本地运行敏感资料不需要上传任何云端服务。这篇文章不堆功能清单只讲我真实跑通的三个场景每一步都能照着做。别急着学原理先花5分钟跑通第一次离线OCRUmi-OCR 的启动方式可能是所有 OCR 工具里最省事的从发布页下载Umi-OCR_Rapid_v2.1.5.7z压缩包解压后双击Umi-OCR.exe即可运行。没有安装向导、没有环境配置、不用装 Python、不用注册账号绿色免安装拷到别人电脑上也能即用即走。软件内置了PaddleOCR 和 RapidOCR 两套本地识别引擎语言模型随软件一起分发所以全程离线——这一点对档案、合同等敏感内容尤其重要。首次打开界面后直接按快捷键呼出截图框选一段文字识别结果马上出现在右侧列表里这就是你的第一次离线OCR体验全程不到一分钟。对比项在线OCR网站Umi-OCR 离线OCR是否联网必须联网全程离线资料隐私文件上传到服务器本地处理不出本机安装成本无需安装解压即用批量处理多有限制文件夹级批量费用免费或按量收费免费开源跑通第一次之后下面三个场景就是我从能用到离不开的真实经历。场景一网页和教材的文字复制不了截图OCR一键截出来遇到的麻烦很典型某篇论文网页右键菜单被禁用选中文字没法复制朋友发来一张教材截图我想摘录一段话只能对着屏幕手打还有那种带水印的文档截图文字全被水印压着。以前的处理方式是截图→手动打字现在 Umi-OCR 给了第二条路截图 OCR。操作只有三步呼出截图快捷键屏幕上出现十字光标框选要识别的区域可以排除水印和无关内容。松开鼠标识别引擎自动工作右侧立刻出现识别文本。在结果上右键复制或点隐藏文字核对原文与识别结果的差异。中英混排的文档记得在设置里明确选择包含英文的语言配置准确率会有肉眼可见的提升。软件内置多国语言库简体/繁体中文、英文、日文、韩文、俄文都能应对。实际体验下来一页教材从截图到拿到可复制的文字从过去的十几分钟手打缩短到十几秒而且识别出来的结果还能直接保存成 txt 归档。场景二上百张图片要转文字批量OCR拖个文件夹就开跑手打一张图尚可忍受但面对几百张图时效率就成了唯一问题。我那次要整理的是手机里一年的聊天记录截图和课程 PPT 翻拍数了数有 400 多张逐张处理不现实。Umi-OCR 的批量 OCR标签页解决的就是这个量级的活把整个文件夹直接拖进左侧文件列表软件会自动搜出文件夹内所有图片包括嵌套子文件夹。点开始任务右侧实时显示进度、单张耗时和置信度识别完成后可以一键导出txt / csv / jsonl格式方便对接 Excel 或下游系统。我在 13 张图的测试批次里看到单张识别耗时普遍在 0.4 秒左右、置信度 0.9 以上图片清晰的情况下。400 多张图跑完大约十几分钟导出成 csv 后按关键词一筛归档工作当天收工——这活如果靠人眼至少是两个小时的机械劳动。截图、录屏里的文字从此都变成了可检索的数据。场景三扫描版PDF不能复制搜索文档识别产出双层PDF回到开头的 600 页档案扫描版 PDF 本质是一堆图片的合订本文字烙在像素里复制不了也搜不到。破局方案是 Umi-OCR 的文档识别功能需 v2.1.4 及以上版本v2.1.5 已内置。双层PDF 的思路一句话就能讲明白底层原样保留扫描图像保证观感和打印效果不变上层叠加一层透明不可见的文字让复制、搜索、摘录全部成为可能。你看到的还是原图但电脑已经认识它了。处理方式能否搜索能否复制排版保真是否联网纯扫描PDF否否完整不需要OCR后导出纯文本能能丢失严重多数需要Umi-OCR 双层PDF能能完整全程离线文档识别的操作链路很短照做即可在文档识别标签页拖入 PDF支持一次拖入几十个文件还兼容 epub、mobi、cbz 等电子书格式。右侧设置面板把保存格式选为双层PDF只想提取文字、不在乎版式的话也可以选单层纯文本PDF。识别语言切换成文档对应的语言中文资料选简体中文别让默认配置硬扛不合适的语言。段落合并模式保持多栏-按自然段换行它会自动识别分栏布局、还原阅读顺序导出的文本基本不用二次整理。点开始任务右侧逐页显示进度单页通常一两秒完成。有个小动作强烈推荐很多文档每页顶部有页眉、底部有页码会混进正文。点击**忽略区域**用鼠标框选出页眉页脚位置还能指定生效的页码范围最终文本的整洁度会明显上一个台阶。完成后验收就两步打开生成的 PDF 按CtrlF 搜一个文档里的词验证可搜索是否生效再随机抽几页目测图像清晰度。我处理 600 页档案就是这条流程半天完成全程断网。这里还有几个值得调的参数从能用进阶到好用排版解析方案遇到双栏论文或报纸默认方案一般能自动分栏扫描版的代码文档建议换单栏-保留缩进直接决定导出文本是能读还是好读。图像压缩对体积敏感的场合压缩质量调到 80% 左右通常是平衡点不敏感就保持默认画质还原最好。OCR页数范围只想处理中间某几页指定页数起始/结束就能跳过无用页面配合忽略区域的页码范围可以对超长文档做精细的分段处理。进阶玩法命令行和HTTP接口把OCR搬进自动化工作流当文件多到要用批次衡量就该上自动化了。Umi-OCR 提供了命令行和HTTP 接口两套自动化入口命令行手册docs/README_CLI.md接口文档docs/http/api_doc.md。命令行入口就是主程序本身几个最常用的指令# 鼠标框选截图并识别 umi-ocr --screenshot # 识别剪贴板里的图片 umi-ocr --clipboard # 识别指定图片或整个文件夹含嵌套子文件夹 umi-ocr --path D:/img1.png D:/image/test # 识别/生成二维码 umi-ocr --qrcode_read D:/xxx.png umi-ocr --qrcode_create 文本内容 D:/输出图片.jpegHTTP 接口的开发流程只有四步上传文件 → 轮询任务状态 → 生成目标文件并获取下载链接 → 清理任务。接口默认监听http://127.0.0.1:1224下面是可直接改用的 Python 示例完整示例见 docs/http/api_doc_demo.pyimport requests, time BASE http://127.0.0.1:1224 # 1. 上传PDF可附带语言、忽略区域等参数 with open(scan.pdf, rb) as f: r requests.post(f{BASE}/api/doc/upload, files{file: f}) task_id r.json()[data][id] # 2. 轮询状态等待识别完成 while True: r requests.post(f{BASE}/api/doc/result, json{id: task_id}) if r.json()[is_done]: break time.sleep(1) # 3. 指定输出为双层可搜索PDF还支持 pdfOneLayer/txt/csv/jsonl r requests.post(f{BASE}/api/doc/download, json{ id: task_id, file_types: [pdfLayered] }) url r.json()[data] # 4. 下载结果文件并清理任务 requests.get(f{BASE}{url}) requests.get(f{BASE}/api/doc/clear/{task_id})把这段逻辑套进批处理脚本整个文件夹的扫描件批量转双层 PDF 只是几分钟的事。基于源码做二次开发的话可以 clone 仓库研究内部实现git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。新手最容易踩的4个坑附排查思路坑一转换后文本和图像位置错位。老版本解析带旋转的页面时确实出现过坐标问题v2.1.2 集中修复过相关内容。用旧版的话先升级到 v2.1.5 再重试若问题依旧检查文档是否包含旋转页面或改用整页强制OCR模式。坑二PDF加密或损坏导致任务卡死。加密 PDF 需要在参数中填写文档密码损坏文件可能让任务一直停在等待状态。遇到异常先看软件日志——v2.1.5 起日志会保存到UmiOCR-data/logs目录能帮你定位到具体是哪一页出了问题。坑三大批量任务吃满内存。识别引擎默认把内存占用控制在系统总内存的一半以内一般够用但低配机器建议在全局设置里调低引擎线程数和内存上限宁慢勿崩。坑四以为双层PDF等于可编辑文档。双层 PDF 的文字层是不可见文本适合检索与复制但双击并不会有光标让你修改文字。如果你要的是带样式的可编辑文件那是另一个需求方向——转换之前先想清楚目标格式能省下很多返工时间。下一步今天就把第一批扫描件转起来从截图救急、批量整理到扫描 PDF 数字化这套扫描件数字化工作流全程离线、免费、免安装值得你今天就动手试一次下载压缩包 → 解压 → 拖进一张截图识别5 分钟就能验证它是否适合你的日常。跑通之后还有几条线可以继续探索截图OCR处理日常网页截图和聊天记录、二维码工具识别和生成二维码、命令行把识别接到自己的脚本里。技术更迭很快但保留图像、叠加文字的双层 PDF 思路依然是档案数字化的主流解法。希望这篇笔记能帮你把第一批扫描件顺利转起来——转完之后你多半会想为什么没早点动手。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表