ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Dolphin 文档解析:PDF 转 Markdown 的两阶段开源方案

Dolphin 文档解析:PDF 转 Markdown 的两阶段开源方案 Dolphin 文档解析PDF 转 Markdown 的两阶段开源方案【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin拿到一份双栏排版的学术论文想把它变成可编辑、能直接喂给 LLM 的 Markdown最头疼的从来不是文字识别而是版式、表格和公式怎么还原。Dolphin 是字节跳动开源的文档图像解析模型ACL 2025核心任务就是 PDF 转 Markdown先把页面切出版式与阅读顺序再对文本、表格、公式、代码分而治之。⚡ 3 分钟跑通第一次转换git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin pip install -r requirements.txt模型权重放在 Hugging Face用 CLI 拉到本地pip install huggingface_hub huggingface-cli download ByteDance/Dolphin-v2 --local-dir ./hf_model对仓库自带的示例页面跑一条解析命令--input_path指向图片、PDF 或整个目录python demo_page.py --model_path ./hf_model --save_dir ./results \ --input_path ./demo/page_imgs/page_1.png跑完在./results下看三样东西markdown/page_1.md是转换好的 Markdownoutput_json/page_1.json带每个元素的 bbox 与阅读顺序layout_visualization/是版式框可视化。能力拆解按内容类型各管一段版式分析与阅读顺序解析分两阶段。第一阶段只做版式定位标题、段落、表格、公式等元素框并给出阅读顺序第二阶段再按顺序逐元素解析内容。双栏论文按读完左栏再右栏的顺序输出而不是按物理位置乱排。标题元素会按 sec_0 到 sec_5 映射成#到###的 Markdown 层级。想只看版式不解析内容跑python demo_layout.py --model_path ./hf_model --input_path 图片即可。表格结构化提取表格元素输出为 HTMLtable标签保留行列结构默认路径会自动从模型输出里抽出干净的 table 标签。手上有裁剪好的单张表格图时直接走元素级接口--element_type table。公式转 LaTeX公式被识别为独立块转成$$...$$包裹的 LaTeX上下标、分式、范数符号这类结构都会保留。单个公式截图可以单独丢给元素级接口--element_type formula。代码块识别代码区域会被标成 code 标签输出时包进围栏代码块注释与缩进都保留--element_type code可单独处理代码截图。元素到 Markdown 的拼装逻辑集中在 MarkdownConverter想弄清某类元素的输出格式读它最快。进阶调优遇到 X 就加 Y元素多、想加快解码--max_batch_size 8默认 4控制同一次并行解码的元素数。公式或表格输出有小瑕疵重复尾巴、多余 quad加--post_process开启后处理。只想核对版式框换用demo_layout.py只输出 bbox、标签和阅读顺序。只有裁剪好的元素图用demo_element.py --element_type text|table|formula|code配--print_results直接看控制台输出。批量处理--input_path指向目录即可多页 PDF 会自动拆页并合成一份带分页线的 md。效果验证下面是一段双栏论文页的实际演示完整走一遍 PDF 转 Markdown左侧是原始页面右侧按阅读顺序并行解析出的内容。版式先定顺序、内容再并行解码这是它对双栏长文档比较稳的原因输出顺序和原文阅读习惯一致不用人工重排。排障清单PDF 报 Failed to convert PDF → 多为加密或损坏文件重新导出后再试。表格或公式格式异常 → 加--post_process切换后处理路径。长输出结尾出现重复内容 →--post_process会截断重复尾巴。怀疑版式框错位 → 打开layout_visualization/里的可视化图核对 bbox。CPU 上推理太慢 → 无 CUDA 时模型以 float 运行建议放 GPU 用 bfloat16。Dolphin 把版式分析和内容解析拆成两阶段让 PDF 转 Markdown 不再靠单一 OCR 硬扛所有元素。克隆仓库把权重拉到./hf_model跑起你的第一份转换。【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表