ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

3条命令把扫描版PDF变成Markdown:MinerU新手实操

3条命令把扫描版PDF变成Markdown:MinerU新手实操 3条命令把扫描版PDF变成MarkdownMinerU新手实操【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU你收到一份200页的扫描版行业白皮书需要的是能直接进RAG知识库的Markdown而不是一页页复制出来的乱码。MinerU就是为此而生的文档解析引擎把PDF、DOCX、PPTX、XLSX和图片转成机器可读的Markdown/JSON公式变LaTeX表格变HTML支持109种语言识别。从安装到出结果只需要3条命令。先搞懂PDF是怎么被读懂的MinerU把解析拆成三层角色预处理层先判断文档是扫描版还是乱码版模型层依次跑版面检测、公式检测和文本OCR管线层做坐标修复、表格合并和阅读顺序排序最后汇总成统一中间态middle_json再输出Markdown和JSON。你可以把它理解为先定位字在哪、再认字是什么、最后排阅读顺序。pipeline、vlm、hybrid三种解析后端可随时切换精度与速度各取所需。三步跑通本地解析没有显卡pipeline后端稳稳起步机器没有独立显卡时pipeline后端是首选纯CPU可跑显存要求最低4GB。先装核心包uv pip install -U mineru[core]这条命令只装核心解析组件不拉vLLM这类重依赖装得快。装完直接解析文档mineru -p demo/pdfs/demo1.pdf -o ./output -b pipeline-p是输入文件也接受目录天然支持批量-o是输出目录。首次运行会自动下载模型并缓存到本地之后直接复用不再重复下载。⚠️ 常见坑默认模型源是huggingface网络不通时先执行export MINERU_MODEL_SOURCEmodelscope否则首次下载模型会一直卡住。有8GB显存切hybrid拿95的精度显卡显存8GB以上Volta架构或更新含Apple Silicon装全家桶uv pip install -U mineru[all]mineru[all]等价于core加vllm包含VLM推理引擎是解锁高精度hybrid/vlm后端的完整形态。然后用同一条解析命令、不加-b参数它会自动选更强的后端mineru -p ./docs -o ./output在官方OmniDocBench v1.6评测里pipeline后端得分86.47hybrid后端95.39差距在复杂版面和公式密集的文档上最明显。坑提示显存吃紧会OOM用环境变量MINERU_VIRTUAL_VRAM_SIZE按实际显存保守设置如设16强制更温和的加载策略。本地没算力轻量客户端连远程服务设备只有CPU但团队有一台GPU服务器时装基础包不要求本地torch即可远程调用uv pip install -U mineru mineru -p input.pdf -o ./output -b vlm-http-client -u http://127.0.0.1:30000-u指向OpenAI兼容推理服务地址vlm-http-client是零重依赖的轻量客户端。GPU机器上运行mineru-openai-server --port 30000即可拉起服务端供多台机器共享。坑提示想换hybrid-http-client的话本地仍需mineru[pipeline]及torch等依赖别和零依赖的vlm-http-client搞混。调优与扩展几个开关管速度配置项作用推荐值MINERU_MODEL_SOURCE切换模型下载源访问不了huggingface时设modelscopeMINERU_DEVICE_MODE强制指定计算设备留空自动探测自动识别失败再设cuda/mps/cpuMINERU_VIRTUAL_VRAM_SIZE显式声明可用显存GB设为略低于实际显存的值MINERU_FORMULA_ENABLE公式解析开关文档无公式时设false省时间MINERU_TABLE_ENABLE表格识别开关默认true组合建议纯文本类报表把公式、表格两个开关都关掉解析耗时更短学术论文场景保持全默认、走hybrid后端版面还原度最佳处理上千页长文档时可调大MINERU_PROCESSING_WINDOW_SIZE默认64页减少处理轮次。完整参数清单见docs/zh/usage/cli_tools.md扩展模块装法见docs/zh/quick_start/extension_modules.md。跑通之后往哪走打开输出目录里的layout/span可视化图质检结果对照原文抽查几页输出文件结构说明在docs/zh/reference/output_files.md接入你的RAG流程MinerU输出天然适配LangChain、Dify、FastGPT等插件集成教程见docs/zh/usage/plugin/想深挖实现解析管线源码在mineru/backend/pipeline/CLI入口在mineru/cli/遇到问题先翻docs/zh/faq/里的FAQ没解决就带样例文件提issue。现在打开终端装上mineru把那份压箱底的PDF变成干净的Markdown吧。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表