
PageIndex MCP 集成完整指南让 Claude 与 Cursor 直接读懂数百页 PDF【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndexPageIndex 是一个无向量、推理式的长文档分析框架先把 PDF 建成类目录的树状索引再让模型在树上推理取回相关页面。配合 MCP 集成你无需维护向量库就能在 Claude 或 Cursor 里直接问答长文档适合常读财报、监管文件与技术手册的人。为什么向量检索在数百页 PDF 上会失灵 传统向量 RAG 先把文档切成块再按语义相似度检索。但相似不等于相关问“一季度收入为什么下滑”时真正相关的段落用词往往和问题差别很大搜到的多是“像但不相关”的片段。文档越长问题越明显——切块后跨章节的上下文被切断模型给了答案你也很难核对它出自哪几页。原理一句话把 PDF 当书读先查目录 想象一位专家读报告先翻目录定位章节再翻到对应页码。PageIndex 做的正是这两步。它先解析 PDF 生成树状索引每个节点带标题、起止页码和一句摘要提问时 LLM 在树上逐层推理从根节点收敛到目标节点。与向量搜索相比它不拿问题和文本片段比相似度而是依据文档自身结构做判断检索路径能落到章节和页码过程可追溯。克隆、装依赖、接 MCP三步跑起来 克隆仓库并安装依赖需 Python 3.8git clone https://gitcode.com/GitHub_Trending/pa/PageIndex cd PageIndex pip3 install --upgrade -r requirements.txt在根目录建.env写入 LLM 密钥OPENAI_API_KEY...再运行下面命令生成树索引python3 run_pageindex.py --pdf_path /path/to/your/document.pdf输出是一个分层 JSON每个节点含标题与页码范围。在 Claude 桌面版或 Cursor 的 MCP 设置里新增一条 PageIndex 服务url填官方开发者页面提供的 MCP 端点鉴权头带上你的密钥。保存后客户端即可看到文档工具仓库里 pageindex/mcp_bridge.py 有对应客户端实现排查接入问题时值得参考。让 Claude 直接读 PDF ️接入完成后在 Claude 对话中先上传或引用目标 PDF让 PageIndex 完成建索引随后可以直接问这份季报里净营收的主要变化是什么公司如何解释年报哪个章节讲风险监测对应哪几页这份监管文件的核心义务条款分别位于哪些部分Claude 作答时会带上章节名与页码引用回原文核对很方便。把 Cursor 当仓库内文档检索工具 ️在 Cursor 里配置同一个 MCP 服务后写代码时顺手查技术文档就变得直接“这个参数默认值是多少手册哪一章写的”PageIndex 会定位 PDF 对应页并返回原文。对接口开发、合规核对这类要频繁对照规格说明的工作相当于在编辑器里常驻了一位会推理的文档读手。用 FinanceBench 验证效果并调参 效果有硬数据基于 PageIndex 构建的金融分析系统 Mafin 2.5在金融文档问答基准 FinanceBench 上取得 98.7% 准确率明显高于传统向量 RAG。上图是 PageIndex Flash 处理不同页数文档的端到端耗时数百页的文档也维持在数分钟量级。建索引时两个参数最值得调--max-pages-per-node默认 10单个节点最多覆盖的页数章节偏长时调大可减少碎片化。--max-tokens-per-node默认 20000节点内容上限长段落密集的文档调小让树更细。长期使用时这两项可以直接写在 pageindex/config.yaml 里。想继续深入三份材料就够cookbook/pageIndex_chat_quickstart.ipynb 是可运行的最小起步示例examples/tutorials/tree-search 讲解查询时如何逐层走树examples/tutorials/doc-search 覆盖文档级检索策略。树索引加推理检索这套组合建议直接拿自己手头的长文档试一轮。【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndex创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考