开源模型

智谱 GLM-OCR 1.0

GLM系列 · 智谱AI(Z.ai) · 2026-02发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

智谱开源的轻量级专业 OCR 模型,仅 0.9B 参数,OmniDocBench V1.5 以 94.62 分登顶,支持文档解析、公式/表格识别、信息抽取,成本约为传统 OCR 的 1/10。

模型基础信息

模型系列GLM系列
开发机构智谱AI(Z.ai)
发布时间2026-02
参数规模0.9B(CogViT 0.4B + GLM 0.5B)
上下文窗口OCR 文档解析
模型类型多模态(OCR 文档理解)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

MaaS 免费额度 开源权重

免费规则详情

智谱开放平台提供 API 免费额度;权重 MIT 开源可自部署。

收费标准简介

MaaS 按量计费(约传统 OCR 1/10);开源权重免费。

模型能力介绍

✅ 核心优势

  • OmniDocBench V1.5 登顶 94.62
  • 9B 轻量,消费级 GPU 可跑
  • MIT 完全开源
  • SDK 一条命令接入

⚠️ 短板与局限

  • 极限复杂版面仍有挑战
  • 单图 ≤10MB / PDF ≤50MB

🎯 适用场景

  • PDF/图片转 Markdown
  • RAG 数据底座
  • 复杂表格与印章识别
  • 边缘端部署

模型使用教程

本章节整理 智谱 GLM-OCR 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:通过智谱 MaaS API 体验(无需 GPU),或在 [Hugging Face](https://huggingface.co/zai-org/GLM-OCR) 查看模型。
  • 能力简介:智谱开源的轻量级专业 OCR 模型,仅 0.9B 参数,OmniDocBench V1.5 以 94.62 分登顶,支持文档解析、公式/表格识别、信息抽取。
  • 适用场景:PDF/图片文档转 Markdown、RAG 数据底座、复杂表格与印章识别、边缘端部署。
  • 使用建议:单图 ≤ 10MB,PDF ≤ 50MB,最多 100 页;成本约为传统 OCR 的 1/10。
  • 开发接入:SDK 一条命令安装(pip install glmocr),或 vLLM / SGLang / Ollama 部署。
  1. 在 [智谱开放平台](https://open.bigmodel.cn) 注册并创建 API Key。
  2. 开源权重下载:[Hugging Face](https://huggingface.co/zai-org/GLM-OCR) / [ModelScope](https://modelscope.cn/models/ZhipuAI/GLM-OCR)(MIT 许可)。
  3. 使用 SDK 免部署体验:pip install glmocr 后配置 API Key 即可。

智谱 MaaS API

curl https://open.bigmodel.cn/api/paas/v4/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"glm-ocr","messages":[{"role":"user","content":[{"type":"image_url","image_url":{"url":"https://example.com/invoice.png"}}]}]}'

SDK 本地使用

pip install glmocr
glmocr parse ./invoice.png --api-key YOUR_KEY

> 提示:返回 Markdown + 版面详情 JSON,可直接用于 RAG。

  • 部署方式:MIT 开源,支持 vLLM / SGLang / Ollama / transformers。
  • 硬件要求:0.9B 参数,消费级 GPU 或 CPU 均可运行。
  • 推荐配置(vLLM,启用 MTP 投机解码加速):
vllm serve zai-org/GLM-OCR --port 8080 \
  --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}' \
  --served-model-name glm-ocr
  • 参考:GitHub(zai-org/GLM-OCR)提供微调(LLaMA-Factory)与 Agent Skill 教程。

💡 使用小技巧

返回 Markdown + 版面详情 JSON,可直接用于 RAG;vLLM 启用 MTP 投机解码加速。

❓ 常见问题 FAQ

Q1:需要 GPU 吗?

A1:可 MaaS 免 GPU 调用,也可 0.9B 本地部署。

Q2:成本如何?

A2:约为传统 OCR 的 1/10。

访问备注与注意事项