
三分钟跑通免费离线 OCRUmi-OCR 从截图识别到图片批量转文本指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR公司内网不通外网、出差在高铁上需要把图片里的文字取出来时在线 OCR 服务就歇菜了。Umi-OCR 是一款免费的离线 OCR 工具文字识别全程在本地完成图片不上传、结果不上传解压后不联网也能跑。它内置屏幕截图识别、图片批量导入、扫描文档识别、二维码扫码造码四类入口日常取文的基本场景都覆盖了。先花 30 秒自测这篇是不是写给你的如果你符合下面任意一条这篇可以照着装经常要从屏幕、文档里抠文字又不想把文件交给在线服务处理手头有一批扫描图片要批量转文本或者想把扫描 PDF 转成可搜索的版本在写脚本想加一步本地跑的命令行 OCR不想注册账号、不想被次数限制找个免费工具先跑起来。如果一条都不沾把它当一份功能清单看也行。从下载到拿到第一段识别文本三选一种获取方式解压发布包下载.7z或.7z.exe自解压格式的发布包解压后双击Umi-OCR.exe就能用。全程没有安装步骤Windows 7 x64 及以上、Linux x64 都能跑。Scoop 安装Windowsscoop bucket add extras scoop install extras/umi-ocr这个包自带 Rapid-OCR 引擎兼容性不错也可以改装extras/umi-ocr-paddle包带 Paddle-OCR 引擎、速度稍快。两者别同时装快捷方式会互相覆盖。源码开发者向git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR首次启动会比平时慢一些那是识别模型在读入内存之后启动就是秒开。首次配置三件事界面语言打开全局设置→语言。界面内置繁中、英语、日语等语言库首次启动会跟随系统语言自动匹配之后随时能改。识别引擎选 Rapid-OCR 或 Paddle-OCR。前者兼容性更好后者速度略快日常用默认即可。截图热键打开截图 OCR页看一眼快捷键。Windows 上默认是WinAltCLinux 为AltC不顺手就点进去重新录制截图过程中按Esc可取消。再确认一件事全局设置里的本地 HTTP 服务保持开启默认就是开的主机选仅本地。这是后面命令行调用的前提。框一下拿到文本切到截图 OCR标签页按WinAltC用鼠标框住屏幕上的文字区域结果自动进剪贴板。右侧记录栏里还能继续编辑跨多条记录划选复制也没问题。到这里截图识别的完整流程就走完了。你手上是什么就点哪个页四个高频场景Umi-OCR v2 用标签页组织功能按需打开就行。对号入座屏幕取词用截图 OCR 页快捷键截图后左侧预览区支持鼠标直接划选复制在别处复制了图片直接粘贴到这一页就能识别粘贴图片的默认热键是WinAltVLinux 为AltV支持重复上一次截图连续处理相邻区域时省掉重新框选的麻烦。批量图片转文本用批量 OCR 页这是图片批量转文本的主力入口没有数量上限一次拖入几百张都行图片格式支持 jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff结果可存 txt、jsonl、md、csv 四种格式其中 csv 能直接用 Excel 打开可设任务完成后自动关机或待机晚上挂机跑文档跑完机器自己下电同样支持文本后处理来整理排版。扫描文档用文档识别页支持 pdf、xps、epub、mobi、fb2、cbz 六种格式扫描版走 OCR 流程电子 PDF 直接提取原有文本可输出双层可搜索 PDF原始版式不变上面多一层隐藏文字关键词能搜到——这是把扫描论文变成正经电子档的关键支持忽略区域去页眉页脚多页批量处理完成后可自动关机。读码、造码用二维码页扫码截图、粘贴或拖入本地图片读取其中的码一张图里多个码也全部识别协议覆盖共 19 种包括 QRCode、DataMatrix、EAN13、EAN8、Code128、Code39、PDF417、Aztec 等二维码和条形码都在内生成码输入文本生成码图片纠错等级等参数可调。两处隐藏设置决定结果干不干净设置一忽略区域先扣掉水印页眉页脚批量处理带 Logo、水印、页码的文档时这些字也会被认进来。处理办法在批量 OCR 页右侧设置里打开忽略区域编辑器按住鼠标右键在图上多画几个矩形把水印可能出现的位置全包进去框内完整的文本块会被任务跳过框外内容照常保留。被跳过的是一整块文本而不是单个字符所以框尽量画大一点才稳。文档识别页也能设同样的忽略区域去页眉页脚正合适。设置二排版解析理顺阅读顺序和代码缩进OCR光学字符识别引擎输出的文本块顺序不一定符合阅读习惯排版解析后处理负责把它理顺多栏-按自然段换行自动识别双栏布局、按自然段换行。论文、报告选它大部分场景就够多栏-总是换行/多栏-无换行每句强制换行或全部并成一行单栏-保留缩进识别代码截图专用保住行首缩进和行内空格结果能直接粘进 IDE不做处理保留引擎原始输出。以上方案都能处理横排和从右到左的竖排文字竖排还要求 OCR 引擎本身支持。识别完不用手工重排行这是它最省事的地方。附带一项中英文混排选组合不选单语图片里中英混杂时在截图 OCR 页按实际内容选包含中英文的组合语言识别率明显好于只选单语。界面语言则随时在全局设置→语言里切换。再进一步把 Umi-OCR 接进脚本命令行入口就是主程序Umi-OCR.exe多数系统可直接写umi-ocr前提是全局设置里开着本地 HTTP 服务。通信只走本地环回不经过物理网卡。两条最常用的命令# 识别文件夹内所有图片含子文件夹结果写入文本文件 umi-ocr --path D:/images --output result.txt # 框选屏幕识别结果复制到剪贴板 umi-ocr --screenshot --clip其余参数按需组合--clipboard识别剪贴板里的图片、--output_append追加写入已有文件、--qrcode_read读图片中的码、--qrcode_create由文本生成二维码、--help查看全部说明。完整参数表在命令行手册。要是你写的是脚本而不是终端命令可以看HTTP 接口手册里的/argv接口把一条命令行发过去效果和终端执行等价。适合把图片转文本固定进日常流程、反复自动跑的场景。动手之前这 6 条能帮你少踩坑硬件底线4GB 内存起步CPU 越强识别越快图片质量扫描文档建议 300dpi 以上模糊的图参数怎么调也救不回来批量策略量大时按每批 50100 张分次跑一条命令还在跑就别发下一条超长图识别不全时进页面设置 → 文字识别把限制图像边长的数值调高输出格式怎么挑JSONL 方便程序处理TXT 方便人读CSV 方便丢进 Excel 统计界面异常截屏闪烁、UI 错位时去全局设置界面和外观里换渲染器或关掉硬件加速。细节去哪查一份常用资料命令行手册全部参数、范围截图与二维码指令的示例HTTP 接口手册图片识别、文档识别、二维码、命令行接口更新日志每个版本新增和修复了什么界面语言与翻译说明界面语言库的维护方式。离线 OCR 的意义说到底就一句你的合同、论文和截图从头到尾都没离开过自己的硬盘。把压缩包解到任意目录运行Umi-OCR.exe第一个识别任务三分钟之内就能跑完。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考