ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

MinerU API 实战指南:3 步跑通文档转 Markdown 解析

MinerU API 实战指南:3 步跑通文档转 Markdown 解析 MinerU API 实战指南3 步跑通文档转 Markdown 解析【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 是一个开源文档解析工具能把 PDF、Office 文档转成可直接喂给 LLM 的 Markdown 和 JSON。它的 API 服务通过mineru-api命令启动把解析能力暴露成标准 RESTful 接口方便你用任意语言接入。下面从零开始先三步跑通第一次请求再按必填 / 常用 / 进阶拆参数最后覆盖常见故障的排查方式。三步跑通安装、启动、发出第一条请求第一步安装依赖并启动服务pip install mineru mineru-api --host 0.0.0.0 --port 8000第二步向/file_parse发一个 multipart/form-data 请求这是整个服务最核心的同步解析接口curl -X POST http://localhost:8000/file_parse \ -F filesdemo.pdf \ -F lang_listch \ -F backendhybrid-engine第三步看返回。Markdown 正文放在results里以文件名命名的字段下其余产物只有显式要求时才会出现{ backend: hybrid-engine, results: { demo: { md_content: # 标题\n\n正文内容…… } } }请求能通了接下来看怎么控制解析行为。/file_parse 参数按三档拆必填、常用、进阶必填项只有一个files— 作用上传待解析文件支持 PDF、图片、DOCX、PPTX、XLSX — 什么时候用每次请求必传不传直接报 400。常用项决定解析质量和速度按参数 — 作用 — 什么时候用记lang_list— 指定 OCR 语言代码默认ch覆盖中、英、日、繁中、拉丁文— 韩语传korean、俄语传east_slavic、阿拉伯语系传arabic一次可传多个值。backend— 选择解析引擎 — 按下表按场景选backend运行位置适合场景pipeline本地多语言 OCR、通用文档hybrid-engine默认本地多语言速度与精度均衡vlm-engine本地中英文档追求高准确率vlm-http-client远程对接 OpenAI 兼容推理服务hybrid-http-client远程多语言 远程推理需少量本地算力parse_method— 取值auto/txt/ocr仅 pipeline 和 hybrid 系列生效 — 有文本层的 PDF 强制传txt最快纯扫描件传ocr。formula_enable、table_enable、image_analysis— 公式、表格、图像/图表分析的开关默认全开 — 文档里没有对应内容就关掉省算力。进阶项处理特殊需求start_page_id/end_page_id控制页码范围从 0 开始默认解析到 99999 页即全文return_middle_json、return_model_output、return_content_list、return_images分别追加中间态 JSON、模型原始输出、内容列表和图片 base64response_format_zip把整个结果打成 zip 返回server_url仅在两个-http-client后端下使用指向远程推理服务地址。参数背后对应一条完整管线预处理做文档分类和乱码检测模型层负责版面、公式、OCR管线层做坐标修复和表格合并最后统一走中间态middle_json输出为 Markdown 等格式。理解这一点你就知道每个开关在影响哪一段。典型场景批量、页码范围、输出控制怎么用批量处理时一条请求里重复传files即可每个文件可配自己的语言curl -X POST http://localhost:8000/file_parse \ -F filesdoc1.pdf -F lang_listch \ -F filesdoc2.pdf -F lang_listkorean页码范围只改两个参数比如只看第 6 到 15 页-F start_page_id5 -F end_page_id15。大文档分片解析就是靠它。输出控制上默认只回 Markdown 已经够轻要归档完整产物时把response_format_zip设为true一次拿全 Markdown、中间 JSON 和图片避免超大 JSON 撑爆 HTTP 响应。长文档别阻塞改用 /tasks 异步接口/file_parse是同步的提交后同一连接里等到任务结束才返回。文档页数多、客户端超时短时容易卡住。这时候换异步三件套POST /tasks参数和/file_parse完全相同立即返回 202 和task_idGET /tasks/{task_id}查状态取值pending/processing/completed/failedGET /tasks/{task_id}/result拿结果任务还在跑时该接口返回 202轮询到 200 即完成。⚠️ 任务结果默认只保留 24 小时超时后task_id查询会返回 404拿到结果请及时落盘。部署与调优3 个关键配置effort 定基线hybrid 系列用effortmedium做默认自动关闭图像/图表分析速度快只有文档含大量图表时才升high。为什么图像分析是耗时大头多数业务文档用不上。parse_method 按文档分治文本型 PDF 走txt速度远高于 OCR扫描件才走ocr。不确定就保持auto让服务自行判别。控制并发服务内部对任务有并发窗口控制默认并发很保守。不要在前端堆线程狂打/file_parse要么调大服务端并发配置要么统一走/tasks排队由服务端按窗口调度。问题排查现象 → 原因 → 解法400 Unsupported file type上传了不支持的格式。原因接口只收 PDF、图片、DOCX、PPTX、XLSX。解法先转格式再传或在客户端做后缀白名单校验。400 Invalid backend / parse_method参数值不在允许集合里。原因backend只认上表五个值parse_method只认auto/txt/ocr。解法按允许值传参旧版别名如vlm-auto-engine会被自动映射但建议直接用新名字。同步请求迟迟不返回大文件在同步接口里会占住连接直到跑完。原因/file_parse会阻塞等待终态。解法切到/tasks异步模式轮询或按页码范围拆小任务。查询任务返回 404任务已过期被清理。原因结果默认保留 24 小时。解法在有效期内及时取回结果或调整服务端保留时长。参数定义和校验逻辑都集中在mineru/cli/api_request.py与mineru/cli/fast_api.py遇到本文没覆盖的行为直接读这两个文件比翻文档更快。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表