智谱 GLM-OCR 1.0
GLM系列 · 智谱AI(Z.ai) · 2026-02发布
模型介绍
智谱开源的轻量级专业 OCR 模型,仅 0.9B 参数,OmniDocBench V1.5 以 94.62 分登顶,支持文档解析、公式/表格识别、信息抽取,成本约为传统 OCR 的 1/10。
模型基础信息
免费额度与收费政策
免费规则详情
智谱开放平台提供 API 免费额度;权重 MIT 开源可自部署。
收费标准简介
MaaS 按量计费(约传统 OCR 1/10);开源权重免费。
模型能力介绍
✅ 核心优势
- OmniDocBench V1.5 登顶 94.62
- 9B 轻量,消费级 GPU 可跑
- MIT 完全开源
- SDK 一条命令接入
⚠️ 短板与局限
- 极限复杂版面仍有挑战
- 单图 ≤10MB / PDF ≤50MB
🎯 适用场景
- PDF/图片转 Markdown
- RAG 数据底座
- 复杂表格与印章识别
- 边缘端部署
模型使用教程
本章节整理 智谱 GLM-OCR 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:通过智谱 MaaS API 体验(无需 GPU),或在 [Hugging Face](https://huggingface.co/zai-org/GLM-OCR) 查看模型。
- 能力简介:智谱开源的轻量级专业 OCR 模型,仅 0.9B 参数,OmniDocBench V1.5 以 94.62 分登顶,支持文档解析、公式/表格识别、信息抽取。
- 适用场景:PDF/图片文档转 Markdown、RAG 数据底座、复杂表格与印章识别、边缘端部署。
- 使用建议:单图 ≤ 10MB,PDF ≤ 50MB,最多 100 页;成本约为传统 OCR 的 1/10。
- 开发接入:SDK 一条命令安装(
pip install glmocr),或 vLLM / SGLang / Ollama 部署。
- 在 [智谱开放平台](https://open.bigmodel.cn) 注册并创建 API Key。
- 开源权重下载:[Hugging Face](https://huggingface.co/zai-org/GLM-OCR) / [ModelScope](https://modelscope.cn/models/ZhipuAI/GLM-OCR)(MIT 许可)。
- 使用 SDK 免部署体验:
pip install glmocr后配置 API Key 即可。
智谱 MaaS API
curl https://open.bigmodel.cn/api/paas/v4/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"glm-ocr","messages":[{"role":"user","content":[{"type":"image_url","image_url":{"url":"https://example.com/invoice.png"}}]}]}'
SDK 本地使用
pip install glmocr
glmocr parse ./invoice.png --api-key YOUR_KEY
> 提示:返回 Markdown + 版面详情 JSON,可直接用于 RAG。
- 部署方式:MIT 开源,支持 vLLM / SGLang / Ollama / transformers。
- 硬件要求:0.9B 参数,消费级 GPU 或 CPU 均可运行。
- 推荐配置(vLLM,启用 MTP 投机解码加速):
vllm serve zai-org/GLM-OCR --port 8080 \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 3}' \
--served-model-name glm-ocr
- 参考:GitHub(zai-org/GLM-OCR)提供微调(LLaMA-Factory)与 Agent Skill 教程。
💡 使用小技巧
返回 Markdown + 版面详情 JSON,可直接用于 RAG;vLLM 启用 MTP 投机解码加速。
❓ 常见问题 FAQ
Q1:需要 GPU 吗?
A1:可 MaaS 免 GPU 调用,也可 0.9B 本地部署。
Q2:成本如何?
A2:约为传统 OCR 的 1/10。
访问备注与注意事项
- GitHub 2026-02-02 开源,含 SDK 与微调(LLaMA-Factory)教程
Aitishiku.com