ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

PDFMathTranslate 快速上手:3 条命令翻出公式与双栏排版无损的 PDF 论文

PDFMathTranslate 快速上手:3 条命令翻出公式与双栏排版无损的 PDF 论文 PDFMathTranslate 快速上手3 条命令翻出公式与双栏排版无损的 PDF 论文【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslate命令名 pdf2zh是一款开源的 PDF 论文翻译工具核心功能是在翻译时保住原版式它先用版面模型找出公式、图表、目录所在区域再只把文字部分送进翻译服务最后把译文排回原位置。每份 PDF 跑完会产出纯译文和双语对照两份文件适合需要读外文文献又在意排版的学生和研究人员。先确认这 3 点再决定用不用 pdf2zh 翻译 PDF一句话定位它是排版保留型的全文翻译工具不做逐页重排翻译后的 PDF 结构和原文一一对应。典型使用场景手上有几篇英文论文要出中文版、需要公式编号和图表编号留在原位、想把本地大模型如 Ollama或 OpenAI 兼容接口接进翻译流程。动手前确认 3 件事输入类型工具解析的是 PDF 文本层带文本层的 PDF 直接可用纯图片扫描件要另外装pip install pdf2zh[ocr]启用实验性 OCR 快速模式且主要针对白底扫描页。默认依赖默认翻译服务是 Google不需要任何 API 密钥装完即用。首次运行的额外准备第一次翻译会下载版面模型wybxc/DocLayout-YOLO-DocStructBench-onnx。网络受限时先把HF_ENDPOINT环境变量设成镜像地址如https://hf-mirror.com再执行翻译。Python 3.11 下 2 条命令装好 pdf2zh产出第一份译文环境要求Python 版本在 3.11 至 3.12 之间。装完后你会得到一个pdf2zh命令第一次翻译跑通即可。pip install pdf2zh把 PDF 放到某个工作目录进入该目录执行pdf2zh document.pdf跑完后当前目录生成两份产物document-mono.pdf纯译文和document-dual.pdf中英对照版。3 个高频场景实操单篇、目录批量、挑页码换服务单篇论文最小命令-li、-lo、-t 指定语言和线程pdf2zh paper.pdf -li en -lo zh -t 2-li/-lo指定源语言和目标语言-t控制并发线程数页数多的文献可以把线程调高。整目录批量翻译 PDF--dir 配 -o 一次出全套文献攒了一整个文件夹时让--dir指向目录-o指定结果落地位置不用一篇篇敲pdf2zh --dir /path/to/papers/ -o results/挑页码与换翻译服务-p 选页-s 指定服务只核对前几页时-p按页码范围挑选比如只翻第 1、2、3、5 页pdf2zh example.pdf -p 1-3,5换服务前先把对应环境变量写好再用-s传服务名。DeepL 对应DEEPL_AUTH_KEYexport DEEPL_AUTH_KEYyour_key pdf2zh example.pdf -s deeplOpenAI 需要OPENAI_API_KEY与OPENAI_BASE_URL支持写成-s openai:gpt-4o-mini直接带模型名本地 Ollama 用OLLAMA_HOST/OLLAMA_MODEL默认指向http://127.0.0.1:11434。服务与变量名的完整对照表见 docs/ADVANCED.md。常用参数汇总参数作用-p只翻指定页码如-p 1-3,5-li/-lo源语言 / 目标语言-s翻译服务支持service:model写法-t并发线程数-o输出目录--dir批量处理目录下全部 PDF--ignore-cache忽略翻译缓存强制重翻--config加载 JSON 配置文件固定参数便于重复执行核对译文公式、双栏、图表编号对不上怎么办翻译流程是先版面检测、后文字翻译DocLayout-YOLO 模型标出公式、图表、目录和注释的位置只有其余文字区域会过翻译服务。所以在dual对照版里重点核对 4 处双栏结构有没有串行公式区域是否原样保留数学符号没被当普通文字翻掉图表编号、脚注、页眉页脚的位置与原文一致公式编号跟着原文走没有漂移。官方演示里同一篇论文翻译前后的对比个别字体被错误翻译时用例外参数-f字体正则和-c字符正则声明哪些字体或字符模式需要原样保留。默认已保留Latex、Mono、Code、Italic、Symbol、Math六类字体规则细节见 docs/ADVANCED.md。不想敲命令GUI、Docker、MCP 三条最短路径浏览器图形界面pdf2zh -i打开http://localhost:7860/拖入文件、选服务、填页码右边实时预览译文详见 docs/README_GUI.md。Docker 容器部署只需映射 7860 端口docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zhMCP 服务器模式pdf2zh --mcp以 STDIO 运行加--sse切到 SSE 模式可接入 Claude Desktop 一类客户端。要在自己程序里调用参考 docs/APIS.md 的 Python API 与 HTTP API 两节。另外Windows 用户可以从 release 页直接下 win64 压缩包双击pdf2zh.exe运行还有 Zotero 插件可在文献管理器里触发翻译。接下来可以做的 3 件事验证挑一篇 10 页以内的短论文翻译逐页翻dual版确认公式编号和分栏位置无错位。排障模型下载失败、服务密钥没生效、代理配置不通按 docs/ADVANCED.md 的小节标题逐个定位。复用把--config配好常用参数搭配--dir和-o之后新增文献到目录后一条命令重跑不用重敲参数。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表