ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

PaddleOCR 3分钟上手:把图片、PDF批量转成可检索的结构化文本

PaddleOCR 3分钟上手:把图片、PDF批量转成可检索的结构化文本 PaddleOCR 3分钟上手把图片、PDF批量转成可检索的结构化文本【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR扫描件里的表格抄不进 Excel合同 PDF 想喂给大模型却只能手工打字PaddleOCR 就是解决这类问题的开源 OCR 工具包它能对 100 语言的文字做检测与识别还能把 PDF/图片整页解析成 Markdown 和 JSON。读完本文你只需两条命令就能让一张图片里的文字变成可编辑、可检索的文本。先搞清它能干什么再动手PaddleOCR 目前的主线能力可以归成三类对应三种最常见的场景通用文字识别paddleocr ocr一条命令自动完成检测文字位置 → 识别文字内容两步支持中文、英文、日文等。新一代 PP-OCRv6 用单个统一模型覆盖 50 种语言不用按语言切换模型中等规格模型仅 34.5M 参数在 A100 上单张推理约 0.13 秒。整页版面解析pp_structurev3能把含标题、正文、图片、表格的复杂页面比如你上面看到的那张报纸版面图解析成带坐标的结构化结果再导出为 Markdown/JSON直接喂给 RAG 或大模型。文档转 Markdowndoc2md命令甚至不依赖图片可以把 Word、Excel、PPT 直接转成 Markdown省掉先转图片再 OCR的弯路。避坑要点PaddleOCR 3.x 要求 PaddlePaddle 3.0 以上版本首次运行时会自动下载模型文件需要联网后续运行就不再下载。两条命令装好环境安装分两步全程 CPU 也能跑# 1. 安装推理框架 PaddlePaddleCPU 版 python -m pip install paddlepaddle # 2. 安装 PaddleOCR 完整功能包 python -m pip install paddleocr[all]装完敲一下paddleocr --version验证。如果只需要基础文字识别、不想装全量依赖把第二步换成python -m pip install paddleocr即可。跑通第一个识别结果拿一张手头的图片合同、票据、截图都行最省事的方式是直接用命令行# 对单张图片做完整 OCR结果直接打印 paddleocr ocr -i ./demo.jpg想拿到结构化输出、写进自己的流程就用 Python APIfrom paddleocr import PaddleOCR ocr PaddleOCR( use_doc_orientation_classifyTrue, # 自动纠正图片方向 use_doc_unwarpingTrue, # 消除拍摄弯曲/褶皱 ) result ocr.predict(./demo.jpg) for res in result: res.save_to_json(./output) # 文字 坐标 置信度output目录里的 JSON 包含每段文字的内容、位置和置信度分数方便你过滤低置信度的结果做人工复核。如果你的目标是整页文档 → Markdown换用版面解析流水线from paddleocr import PPStructureV3 pipeline PPStructureV3() for res in pipeline.predict(./page.png): res.save_to_markdown(./output) # 标题、正文、表格结构都保留生成的 Markdown 里表格会以表格形式还原正文按阅读顺序排列——这正是把它接进大模型知识库的关键。两个值得知道的进阶点批量处理不用写循环。命令行和predict的输入都支持传入文件夹路径或路径列表整批图片一次跑完。配合--device参数还可以指定gpu:0、npu等硬件有显卡的机器速度会有明显提升。给大模型用精度还能再高一档。对古文、生僻字、印章这类硬骨头可以用视觉语言模型 PaddleOCR-VL 系列——0.9B 的轻量模型在 OmniDocBench 上做到 96.3% 的解析精度同样输出 Markdown/JSON和你上面的代码无缝衔接。Dify、RAGFlow 等主流知识库项目底层用的就是它说明这条路已被生产环境验证。立即开始按上面的两条命令装好 PaddlePaddle 和paddleocr[all]挑一张你手头最头疼的扫描件跑paddleocr ocr -i看第一份结果遇到整页文档再试一次PPStructureV3导出 Markdown那些原本要手动敲进表格的文字现在应该已经躺在你的output目录里了。想深入了解各命令行参数和模型配置可以看仓库里的 快速上手文档更多问题可查 docs/FAQ.md。觉得有用的话点赞收藏下一篇聊聊如何把 OCR 结果接进自己的知识库。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表