ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

GLM-OCR Ollama本地部署教程:最简单的本地文档OCR方案

GLM-OCR Ollama本地部署教程:最简单的本地文档OCR方案 GLM-OCR Ollama本地部署教程最简单的本地文档OCR方案【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCRGLM-OCR 是一款面向复杂文档理解的多模态 OCR 模型总参数量仅 0.9B本文带你用 Ollama 在本地完成 GLM-OCR 部署实现免 GPU 的文档 OCR 识别——把 PDF、截图、手写稿转成结构化 Markdown数据全程不出内网是个人与轻量团队最省心的本地文档 OCR 方案。为什么选择 Ollama 做 GLM-OCR 本地部署相比 vLLM、SGLang 等推理框架Ollama 的优势对新手非常友好零门槛一条命令安装、一条命令拉取模型无需配置 CUDA 环境CPU 也能跑GLM-OCR 仅 0.9B 参数官方文档明确推荐纯 CPU 场景用 Ollama隐私安全文档图片完全在本地处理适合处理合同、财报等敏感材料生态通用Ollama 是本地部署大模型的事实标准学会后可复用到大模型项目官方 Ollama 部署指南位于 examples/ollama-deploy/README.md核心配置逻辑实现在 glmocr/ocr_client.py 中默认配置模板见 glmocr/config.yaml。第一步安装 Ollama 并拉取 GLM-OCR 模型macOS / Linux在终端执行官方安装脚本访问 Ollama 官网下载即可安装后服务默认运行在http://localhost:11434curl -fsSL https://ollama.ai/install.sh | sh ollama --version # 验证安装Windows从 Ollama 官网下载安装包双击安装即可。接着拉取 GLM-OCR 模型ollama pull glm-ocr:latest ollama list # 确认模型已就位如果服务没有自动启动执行ollama serve手动拉起。第二步安装 GLM-OCR SDK 并配置本地部署需要自部署完整流水线版本包含版面分析模块pip install glmocr[selfhosted]然后在项目目录创建config.yaml这是最关键的一步——必须使用 Ollama 原生接口否则会报 502 错误pipeline: maas: enabled: false ocr_api: api_host: localhost api_port: 11434 api_path: /api/generate # Ollama 原生端点 model: glm-ocr:latest # 必须指定模型名 api_mode: ollama_generate # 使用 Ollama 原生请求格式⚠️避坑提示Ollama 的 OpenAI 兼容接口对视觉请求支持有限官方推荐直接使用原生/api/generate端点。这也是新手最常踩的 502 Bad Gateway 坑。第三步一行命令完成文档 OCR配置完成后解析一张图片只需一条命令glmocr parse examples/source/code.png --config config.yaml仓库自带多种示例素材可以直接试跑示例素材路径考察能力代码截图examples/source/code.png代码结构还原手写中文examples/source/handwritten.png手写体识别财务表格examples/source/table.png复杂表格学术论文examples/source/paper.png数学公式批量处理整个目录或指定输出目录glmocr parse examples/source/ --output ./results/看看 GLM-OCR 本地识别效果下面这些图片都来自仓库的示例结果目录是 GLM-OCR 真实跑出的版面分析效果技术文档中的正文、公式、条款编号均被准确框出并分类手写中文场景GLM-OCR 将整段手写内容识别为可编辑 Markdown财报表格以 0.93 的置信度被整体检出转换后保留完整行列结构学术论文双栏排版正文与 LaTeX 公式分别识别还原度高对应的结构化结果Markdown JSON 版面详情可查看 examples/result/handwritten/handwritten.md 和 examples/result/paper/paper.md。验证部署是否成功三步检查快速定位问题ollama list # 1. 模型是否在本地 ollama ps # 2. 模型是否在运行 curl http://localhost:11434/api/generate \ -d {model:glm-ocr:latest,prompt:Hello,stream:false} # 3. API 是否通常见问题速查报 502 Bad Gateway检查config.yaml中api_path是否为/api/generate、api_mode是否为ollama_generate缺少model字段也会导致失败解析速度慢首次调用模型需加载进内存属正常现象CPU 部署大 PDF 建议逐页处理想换自定义模型可用 Modelfile 创建方法见官方指南 examples/ollama-deploy/README.md生产环境建议与总结官方给出的选型建议是个人测试、CPU 机器 → Ollama高并发生产服务 → vLLM / SGLangApple Silicon 用户还有专门的 MLX 部署方案。回顾一下整个 GLM-OCR Ollama 本地部署流程总共只有四步安装 Ollamaollama pull glm-ocr:latestpip install glmocr[selfhosted]写好config.yaml记得api_mode: ollama_generateglmocr parse 你的文件.png开跑 从安装到出结果熟练后 10 分钟内即可完成。如果你的场景是对内网的合同、票据、扫描件做批量电子化这套本地文档 OCR 方案在成本与隐私之间取得了很好的平衡。更多架构细节可阅读 glmocr/pipeline/pipeline.py 中的流水线实现或直接查阅仓库主文档 README_zh.md。【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表