ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Umi-OCR 实用指南:5 分钟搞定免费离线文字识别

Umi-OCR 实用指南:5 分钟搞定免费离线文字识别 Umi-OCR 实用指南5 分钟搞定免费离线文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR 软件解压即用、不联网也能识别文字。它支持截图取字、批量图片识别、PDF 文档转文本、二维码扫描与生成内置中、英、日、韩等多国语言识别库。适合经常处理截图、扫描件、图片文档的办公用户也适合想把 OCR 能力嵌进自动化流程的开发者。支持 Windows 7 及以上 x64 系统和 Linux x64。一、认识 Umi-OCR装好就能用的功能清单功能一览软件主界面由多个标签页组成按需打开即可。核心功能与对应入口如下功能标签页适合场景截图 OCR截图OCR提取屏幕上的文字、代码批量 OCR批量OCR一次性识别几百张图片文档识别文档识别PDF 扫描件提取文本二维码二维码扫码、生成二维码图片全局设置全局设置语言、主题、引擎、快捷键安装与启动无需安装下载发行包.7z压缩包或.7z.exe自解压包解压后直接运行Umi-OCR.exe即可。软件会自动读取./UmiOCR-data/.settings配置文件界面上做的所有调整都会保存进去方便手动微调。二、截图提取文字从划框到复制只要三下调出截图并识别打开「截图OCR」标签页用默认快捷键唤起截图快捷键可在全局设置中自定义框选屏幕区域后自动开始识别。识别结果出现在右侧记录栏可以直接划选复制也支持编辑文字、合并多条记录一起复制。如果刚在别处复制了图片也可以直接粘贴进 Umi-OCR 识别。排版解析方案怎么选识别出的原始文字块需要按排版规则重排Umi-OCR 提供了多套预设方案tbpu.parser参数方案参数值适用情况多栏-按自然段换行multi_para默认方案适合大部分文档多栏-总是换行multi_line每句话都强制换行单栏-保留缩进single_code代码截图保留行首缩进单栏-无换行single_none把多行合并成一段不做处理none引擎原始输出提取代码片段时选「单栏-保留缩进」缩进和行内空格都能保住复制出来即可直接粘贴进编辑器。三、批量 OCR几百张扫描图一次跑完批量处理的操作步骤打开「批量OCR」标签页拖入图片或整个文件夹支持嵌套子文件夹右侧选择输出格式与保存路径输出支持txt、jsonl、md、csv(Excel)如需排除水印或页眉页脚进入「忽略区域」编辑器见下点击开始任务可勾选完成后自动关机或待机适合下班前挂机跑完。输入格式输出格式备注jpg / jpeg / png / webp / bmp / tif / tifftxt纯文本与文件名一一对应同上jsonl结构化数据含文本框坐标同上md / csv方便归档和表格处理忽略区域把水印挡在门外批量识别带固定水印的图片时可在右栏设置中打开忽略区域编辑器按住右键在预览图上绘制矩形框框内的文字会被整体跳过。注意两点矩形要画得足够大完整包住水印可能出现的所有位置只有整个文本块落在框内才会被忽略只被框住一半的文本块仍会保留。大图识别要调的参数识别像素很大的长图、大图时请调整「页面的设置 → 文字识别 → 限制图像边长」把数值调高。该参数ocr.limit_side_len默认 960会压缩超大的图片数值越小速度越快、精度越低按图片实际大小权衡即可。四、PDF 文档识别与二维码工具文档识别的两个用途「文档识别」标签页支持pdf, xps, epub, mobi, fb2, cbz格式主要干两件事一是对扫描件做 OCR 提取文本二是把结果输出为双层可搜索 PDF保留原始版式的同时支持文字检索。同样支持设置忽略区域排除页眉页脚以及任务完成后自动关机。二维码识别与生成二维码标签页支持截图、粘贴、拖入图片三种输入方式可识别一张图中的多个码覆盖 19 种协议QRCode、EAN13、Code128、PDF417 等并支持条形码。反向操作也内置了输入文本即可生成二维码图片可设置纠错等级和输出尺寸。五、常见问题快速排查识别结果不准怎么办按顺序检查三件事语言模型选错识别英文代码用了中文模型错字会明显变多在全局设置里切换对应语言图片被过度压缩小字、长图场景把「限制图像边长」调高或启用「纠正文本方向」ocr.cls代价是速度变慢排版乱换个排版解析方案多栏文档用multi_para代码用single_code。批量任务太慢怎么提速批量页支持同时处理大量图片遇到速度瓶颈时可以调大识别并发在页面设置中调整、输出格式选 txt 而不是 jsonl数据量小写入更快、提前用忽略区域去掉大片无关区域。如果机器空闲任务排好后挂到晚上跑完直接关机是最省心的方案。命令行调不出来结果命令行依赖 HTTP 服务做跨进程通信确认两件事全局设置里HTTP 服务已启用默认开启主机选「仅本地」即可一次多图识别耗时较长等当前命令结束再输入下一条。结果回传受系统管道限制可能收不到需要用程序调用时改用 HTTP 转发命令行 更稳。六、命令行与 HTTP 接口把 OCR 接进自动化常用命令行指令命令行入口就是主程序常用指令如下完整列表见 命令行手册umi-ocr --screenshot --clip # 截图识别结果进剪贴板 umi-ocr --path D:/imgs -- result.txt # 识别文件夹结果写入文件 umi-ocr --qrcode_read D:/qr.png # 识别二维码指令支持简写如--screenshot可写成--sc--output也可用箭头--代替。HTTP 接口调用在「全局设置」中确认 HTTP 服务开启后默认端口 1224就能用标准 HTTP 请求调用识别能力。图片识别接口为POST /api/ocr传入 base64 编码图片和可选参数GET /api/ocr/get_options可先查询当前引擎支持的全部参数及默认值。一个最小调用示例import base64, json, requests img_b64 base64.b64encode(open(a.png, rb).read()).decode() resp requests.post( http://127.0.0.1:1224/api/ocr, json{base64: img_b64, options: {ocr.language: models/config_chinese.txt, tbpu.parser: multi_para, data.format: text}}) print(resp.json()[data])常用参数对照见 图片OCR接口文档完整手册见 HTTP接口手册。注意接口对并发支持有限建议串行调用长时间大批量连续调用偶发连接错误时重试即可。七、全局设置值得顺手改的几项高频设置项设置项说明语言 / Language切换界面语言首次启动按系统语言自动匹配主题与字体多种亮/暗主题可调字号与字体OCR 引擎切换识别插件如 RapidOCR / PaddleOCR快捷键自定义截图、剪贴板识别等快捷键开机自启 / 快捷方式一键配置渲染器出现截屏闪烁、UI 错位时切换渲染方案或关闭硬件加速界面语言切换在「全局设置」→「语言/Language」中可手动切换简体中文、English、日本語 等界面语言翻译文件位于UmiOCR-data/i18n/目录想补充新语言可参考 dev-tools/i18n/README.md 中的翻译流程。Umi-OCR 把截图取字、批量跑图、PDF 转文本、二维码这四类高频需求装进了同一个离线工具里配合命令行和 HTTP 接口还能无缝接入自动化脚本。想深入参数细节从 官方说明 和 docs/ 目录 入手即可。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表