ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

MarkItDown 教程:免费把 PDF 和办公文档批量转换成 Markdown

MarkItDown 教程:免费把 PDF 和办公文档批量转换成 Markdown MarkItDown 教程免费把 PDF 和办公文档批量转换成 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown把一堆 PDF、Word 文件喂给大模型之前第一件事都是先把文字取出来。MarkItDown 是微软开源的一个轻量转换工具一条命令就能把 PDF、Word、Excel、PowerPoint、图片、音频、HTML 等文件转成 Markdown并且保留标题、列表、表格这些结构。不需要注册账号、没有配置门槛做知识管理、文档整理的人都能直接上手。它适合谁、解决什么问题如果你在用大模型搭建知识库或 RAG 流程各种格式的文件必须先变成模型能读的文本。手工复制粘贴会丢掉全部结构标题、表格、列表糊成一团后续检索质量直接受损。如果你是编辑、运营或研究人员典型场景是手头有几十页的报告想提取文字交给 AI 总结或存进笔记库。以前这一步要么靠付费转换工具要么纯手工搬现在一条命令就完成全程不需要写代码。人群典型痛点MarkItDown 的解法知识库 / RAG 搭建者文件要先变成结构化文本转 Markdown 时保留标题、列表、表格编辑、研究人员复制粘贴丢格式、清理麻烦一条命令输出可读的 .md 文件Python 开发者十几种文件格式没有统一解析入口一个 convert() 调用自动识别格式从零到第一次成功运行环境要求只有一个Python 3.10 及以上。建议先建一个干净的虚拟环境避免依赖冲突。方式一推荐从 PyPI 安装[all]表示装齐全部格式支持。python -m venv .venv source .venv/bin/activate pip install markitdown[all]Windows 用户激活虚拟环境改用.venv\Scripts\activate。方式二从源码安装适合想读代码或改代码的人。先git clone https://gitcode.com/GitHub_Trending/ma/markitdown进入目录后执行pip install -e packages/markitdown[all]。如果只用得到一两种格式可以按需装比如markitdown[pdf,docx,pptx]安装更轻、速度更快。装好后找一份手边的 PDF 执行markitdown report.pdf -o report.md稍等片刻同目录会出现 report.md。打开看一下正文、标题、表格都在且都是 Markdown 语法。这就是你的第一次成功运行。文件也可以走管道cat report.pdf | markitdown。用一个真实任务串起完整流程PDF 转 Markdown任务是把一份多页论文转成 Markdown准备喂给大模型做问答。输入任意一份带文字层的 PDF。项目测试数据里就有这样的样本下面是其中一页AutoGen 论文首页执行markitdown paper.pdf -o paper.md。工具读取文件、提取文字层按页输出。结果打开 paper.md你会拿到三样东西。正文按原顺序输出页与页之间用!-- page 1 --这类注释标出断页标题层级、列表、脚注保留为 Markdown 语法表格变成标准 Markdown 表格人和模型都能直接读。如果是纯图片扫描的 PDF内置转换器取不到文字那就需要下面要讲的 OCR 插件了。三个亮点功能讲透LLM 辅助的图片理解。很多 PPT 和照片里关键内容只存在于图片中。给 MarkItDown 传入一个 LLM 客户端它就能在转换时顺手生成图片描述from markitdown import MarkItDown from openai import OpenAI md MarkItDown(llm_clientOpenAI(), llm_modelgpt-4o) print(md.convert(slides_with_images.pptx).text_content)项目自带的这张测试图就是典型输入文字和图形混在一起交给视觉模型才能完整读懂扫描件 OCR。仓库里的 markitdown-ocr 插件见 packages/markitdown-ocr/给 PDF、Word、PPT、Excel 转换器加上 OCR 能力识别文件内嵌图片里的文字。pip install markitdown-ocr安装后构造转换器时带上enable_pluginsTrue并传入llm_client即可不传 LLM 客户端时会自动退回内置转换器不会报错。插件机制。核心包只带内置转换器扩展全部走插件markitdown --list-plugins列出已装插件--use-plugins按需启用。主转换逻辑集中在 packages/markitdown/src/markitdown/代码量不大想改行为可以直接看。进阶与部署选项想在容器里跑仓库根目录就带 Dockerfiledocker build -t markitdown:latest .构建后把文件从标准输入喂进去——docker run --rm -i markitdown:latest report.pdf output.md适合 CI 脚本或没装 Python 的服务器。另有一个独立包 markitdown-mcppip install markitdown-mcp得到一个本地 MCP 服务对外暴露一个convert_to_markdown工具AI 客户端可以直接调用 MarkItDown。默认只绑定 localhost面向本机可信环境说明在 packages/markitdown-mcp/ 里。踩坑与排错转换时报不支持该格式 → 默认装的可能没带对应格式依赖改用markitdown[all]或补装[pdf]、[docx]等对应组件。提示markitdown: command not found→ 虚拟环境没激活或安装目录不在 PATH 里重新激活 venv 再执行。扫描件 PDF 转出来是空的 → 扫描页没有文字层内置转换器不做识别装 OCR 插件或换用云端文档智能服务。安装时报 Python 版本错误 → 最低要求 3.10用python --version确认必要时装更高版本。复杂版式的表格转得支离破碎 → 本地转换不做版面重建嵌套表格效果一般属正常现象追求高保真就切到云端端点。大文件转换慢 → 几百页的 PDF 需要点时间属正常可以拆分分段转换或只处理需要的部分。MarkItDown 解决的是很朴素的一件事把文件变文字变成一条命令的事。无论是给大模型备料还是单纯想把文档里的文字批量取出来都值得把它装进工具箱——装一次下次再遇到想交给 AI 的 PDF你大概已经会敲那条命令了。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表