ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

免费离线OCR软件Umi-OCR:截图、成堆照片和扫描PDF怎么快速转成文字?

免费离线OCR软件Umi-OCR:截图、成堆照片和扫描PDF怎么快速转成文字? 免费离线OCR软件Umi-OCR截图、成堆照片和扫描PDF怎么快速转成文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上个月我用免费离线OCR软件Umi-OCR处理了三类材料286张书页照片、一本512页没有文字层的扫描旧书外加几十张课件截图全程在一台断网的机器上完成前后花了3天没有一个字节的数据经过网络。本文只讲实测过程和踩过的坑不罗列功能表。从零到出第一个识别结果怎么跑通发行包下载下来有.7z和.7z.exe两种前者要装解压工具后者是自解压包没装压缩软件的电脑直接双击也能解开。解压后不用安装双击Umi-OCR.exe就启动。首次打开时界面语言跟随系统走想手动改就在全局设置→语言里切简中、英文、日文等。主界面是标签页结构截图OCR、批量OCR、文档识别、二维码、全局设置。建议先点右上角的锁锁定标签页日常操作不会手滑把工作页关掉。第一次用直接进截图OCR页按预设的截图快捷键可在设置里改屏幕出现取景框框住目标松手右侧就出识别结果划一下就能复制。框选、粘贴图片、拖本地图进窗口三种输入方式都试过了都能跑。两个容易卡住的默认值图片只认 jpg、png、webp、bmp、tif 这几类格式HEIC 得先转一下快捷键是预设的不配置也能用。三个真实任务截图、成堆照片、500页PDF分别怎么处理轻量任务代码和论文截图怎么识别完不用再重排痛点截图识别后直接复制代码缩进全丢粘贴进编辑器要手工重排多栏论文更糟左右栏文字交叉错乱读起来像打乱了顺序。操作截图OCR页右侧设置里找到排版解析方案。代码截图选单栏-保留缩进首行缩进和行内空格原样保留多栏论文选多栏-按自然段换行左右栏按阅读顺序输出。结果一页代码截图直接粘进编辑器没有一处空格对不上A4 双栏论文识别几秒出结果输出顺序和阅读顺序一致。右侧记录栏还能划选多条一起复制。收尾叫不做处理的方案是引擎原始输出默认每句都换行嫌碎可以先选单栏-按自然段换行找个中间状态。中等任务几百张照片怎么一次跑完还把水印去掉痛点相册里 286 张书页照片每张右上角带拍摄时间水印、页脚带阴影。不处理的话导出的 txt 里每几行就混进一串2024-05-12后面清洗比识别还费时间。操作批量OCR页把图片全拖进任务列表进右侧设置的忽略区域编辑器按住右键画矩形框盖住水印位置框尽量画大、完全包住水印可能出现的所有位置再选好导出格式点开始任务。结果286 张图一批跑完列表里每行显示耗时约 0.40.9 秒全程 5 分多钟支持导出 txt、jsonl、md、csvExcel 直接打开四种格式成品里一条水印串都没有省掉一轮人工录入。收尾忽略区域只对整个文本块生效——半个字在框内、半个字在框外时整块都保留。画框时宁可画大一点别差着边。重度任务扫描版PDF怎么一键变成能搜索的痛点512 页的扫描旧书没有文字层全文搜索是空操作查一个术语只能一页页翻手工誊录根本不可行。操作文档识别页支持 pdf、xps、epub、mobi、fb2、cbz 六类格式拖入文件后输出类型选双层可搜索PDF每页页眉页脚都有书名和页码提前画好忽略框把这些区域排除再开启任务完成后自动关机睡前挂上。结果一晚上跑完 512 页。成品原图在底、透明文字浮在上面像原书一样翻页又能全文搜索——把术语丢进搜索框几秒内相关段落全部跳出来。收尾双层PDF体积比纯文本大但既能看原图又能搜字对见不得光的资料来说这是最平衡的存档形态。它做不好什么三条局限和三个我踩过的坑坦率说三条局限手写体和低清老照片的识别率比不了云端服务。我的折中理由是资料不能上网离线是刚需牺牲一点极限准确率可以接受。只支持 Windows 7 x64 和 Linux x64Mac 用户没有原生版本。识别走纯 CPU超大图、超长图明显偏慢多任务同时排队时进度条会肉眼可见地变慢。三个坑都按现象→定位→解法记一下现象超长截图的后半段文字丢了。定位默认有限制图像边长像素超限会被裁。解法批量识别页设置→文字识别→把限制图像边长的数值调高重跑就完整了。现象个别电脑上截屏闪烁、界面错位。定位界面默认显卡加速渲染和某些显卡驱动不合拍。解法全局设置→界面和外观→渲染器换渲染方案或关掉硬件加速。现象命令行敲了没反应。定位命令行依赖内置 HTTP 服务跨进程通信服务没开就静默失败通信只走本地环回不经过物理网卡。解法确认全局设置里 HTTP 服务已开启主机选仅本地。进阶用法三个不显眼但实用的小地方命令行umi-ocr --screenshot直接截屏识别umi-ocr --path D:/图片传入文件夹里面所有图片含子文件夹批量识别umi-ocr --qrcode_create 文本内容 输出.png生成二维码。所有指令都能用前几个字母简写完整清单umi-ocr --help里有。HTTP 接口接口手册放在 docs/http/ 目录可以把 OCR 能力嵌进自己的脚本或小工具里二维码页支持 19 种码制协议的识别与生成还能调纠错等级。多语言界面简中、繁中、英文、日文等随系统自动切换也可在全局设置→语言手动改仓库里dev-tools/i18n/放着翻译维护脚本翻译协作是长期在做的。结论Umi-OCR适合谁第一步做什么最打动我的就三点全程离线资料不离开本机解压即用连安装步骤都省了批量扎实图片和 PDF 都能成批处理。适合谁资料有保密要求的人、要批量清截图和扫描件的人、想折腾自动化的动手党。不适合谁追求手写识别极限精度的人以及 Mac 用户。第一步动作下载发行包→解压→运行 Umi-OCR.exe打开截图OCR页按默认快捷键在屏幕上框一块区域。等右侧面板跳出第一行字你再决定要不要删掉收藏夹里那个在线OCR网站。下次再对着一摞扫描件找术语就让它在白天跑着——你出去买杯奶茶回来文字都在。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表