ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

免费离线OCR软件实测:500页扫描PDF和300张照片,断网也能转成可检索文本

免费离线OCR软件实测:500页扫描PDF和300张照片,断网也能转成可检索文本 免费离线OCR软件实测500页扫描PDF和300张照片断网也能转成可检索文本【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR512 页无文字层的扫描版 PDF、327 张带水印的书页照片全部转成了可检索、可复制的文本全程断网识别全部发生在本机——完成这件事的是 Umi-OCR一款免费、开源的离线 OCR 软件。这里只讲三类真实材料和踩过的坑。免费本地OCR工具的数据和代码到底去哪了选免费工具先回答一个现实问题我的图片去了哪里。Umi-OCR 的答案很直白——代码全部开源发行包里的UmiOCR-data目录下就是main.py和py_src源码你可以自己翻。识别引擎和多国语言识别库都内置在发行包里不联网、不下载任何额外模型断网状态下功能一个不少。需要网络参与的只有命令行和 HTTP 接口而且文档写得很清楚通信只走127.0.0.1本地环回不经过物理网卡。全局设置里的主机选项默认就是仅本地图片文件不会离开这台电脑。如果你还是介意把源码拉下来看个明白git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。要提前说明的是离线引擎对模糊材料的准确率有天花板这是离线方案绕不开的代价后面会具体说。从解压到跑出第一段文字最短路径下载发行包.7z需要压缩软件.7z.exe是自解压包没有 7-Zip 就选后者双击即可解开。解压后直接运行Umi-OCR.exe无需安装步骤。打开截图OCR标签页按下预设截图快捷键框选屏幕区域松手后右侧识别记录栏立刻出文字。新手最容易卡住的一个细节首次打开时界面语言会跟随系统设置自动切换英文系统看到的就是一身英文。想换回中文走全局设置→语言/Language。主界面由一排标签页组成截图OCR、批量OCR、文档识别、二维码、全局设置。建议先把标签栏右上角的锁定标签页打开日常操作不会手滑关掉工作页。截图页除了框选还支持从别处复制图片直接粘贴、把本地图拖进窗口三种输入我都试过。300张带时间水印的书页照片怎么批量识别材料327 张扫描书页照片jpg 格式每张右上角都压着拍摄时间水印页脚偶尔有阴影。操作打开批量OCR页把整个文件夹拖进任务列表点开始。支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff数量没有上限。右栏设置里进忽略区域编辑器按住右键把水印可能出现的位置框住——框画大一些完全包住。跑完导出格式可选txt、jsonl、md、csv(Excel)四种。效果忽略区域只对整块落在框内的文本生效半遮的不算——这是文档里的规则框水印时别画得太抠。跑完那批照片结果文件里的 2024-05-12 全部消失正文干净。导出csv(Excel)给同事核对省掉一轮人工录入。512页无文字层扫描PDF如何转成能搜索的双层PDF材料一本 512 页的扫描版 PDF没有文字层翻页等于一张张看照片。操作打开文档识别页把文件拖进去——这一页支持pdf, xps, epub, mobi, fb2, cbz。选择输出双层可搜索PDF原图在底层透明文字浮在上面。提前画好忽略区域框住每页重复的书名和页码。任务支持暂停也支持完成后自动关机/待机睡前挂上不耽误。效果成品既能像原书一样翻页又能全文搜索、划词复制。把一个术语丢进搜索框几秒内所有相关段落跳出来省掉一页页翻的时间忽略区域生效后正文里不再重复出现几十遍的书名页脚。踩过的3个坑以及它做不到的事长截图后半段文字丢失。症状是长图只识别出前一半剩下的像被裁掉了。根因是批量OCR页设置里的限制图像边长默认值偏小长图被按默认边长处理。解决路径是批量OCR页 → 页面的设置 → 文字识别 →限制图像边长把数值调高后重跑尾部内容完整。这是官方 README 里明确写的处理方式。界面闪烁、UI 错位。出过截图时界面抖的情况和显卡加速渲染有关。处理位置在全局设置 →界面和外观→渲染器换一种渲染方案或关闭硬件加速问题就消了。忽略区域框不干净就白画。再强调一次规则只有整块文本完全落在框内才会被忽略单个字符不单独处理。框得半遮半掩水印照样进结果。做不到的事直说手写体、光照不均的低清老照片识别率明显掉档同类型材料上云端引擎更准。这不是设置能救的是离线模型的天花板。另外文档识别在 Windows 7 和低配 CPU 上早期版本出过问题用的是老系统就先更新到新版再跑。命令行和HTTP接口给爱折腾的1~2个用法命令行入口就是主程序本身记住两条就够umi-ocr --screenshot直接截屏识别。umi-ocr --path D:/imgs --output out.txt把文件夹整个丢进去批量识别结果写文件路径可以多个。二维码标签页既能扫也能生成支持 19 种码制协议生成时可设纠错等级HTTP 接口默认开在127.0.0.1:1224只允许本地环回访问把参数列表 POST 过去即可接口手册放在项目的docs/http目录里。文档提醒过并发能力弱长时间大批量连续调用偶发ECONNREFUSED报错重发一次就行别指望它扛多请求并行。谁适合用三步10分钟先试一把适合资料不想上云、有一批图片/扫描件/旧PDF要处理、图省事不想装东西的人。不适合主力需求是手写体和重度模糊老照片的人或者找 Mac 版的人——目前只覆盖 Windows7 x64 和 Linux x64。三步最小试用10 分钟内下载发行包用自解压包省掉解压软件。解压后运行Umi-OCR.exe。进截图OCR页按快捷键框一小块屏幕文字看右侧面板出字。出第一段文字之后你再决定它进不进入你的工作流。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表