OCR智谱AI视觉闭源 多模态模型

GLM-4V GLM-4V

GLM系列 · 智谱AI · 2024-01发布

闭源多模态国内可直连有免费额度

模型介绍

智谱 AI 的图像理解模型,支持图片描述、OCR、表格识别与多图对比,可接入 RAG 与 Agent 的多模态流程。

模型基础信息

模型系列GLM系列
开发机构智谱AI
发布时间2024-01
参数规模闭源(未公开)
上下文窗口8K
模型类型多模态(视觉 + 文本)
中文能力优秀
使用方式网页体验 / API调用

免费额度与收费政策

限免体验 按量付费

免费规则详情

开放平台提供试用额度。

收费标准简介

按 token 计费(含图像 token,以官方为准)。

模型能力介绍

✅ 核心优势

  • 图像理解好
  • 中英 OCR 强
  • 国内直连

⚠️ 短板与局限

  • 上下文较短
  • 视频暂不支持

🎯 适用场景

  • 文档 OCR
  • 图表理解
  • 多模态 RAG

模型使用教程

本章节整理 GLM-4V 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

暂无内容,可前往官方文档查看。

暂无内容,可前往官方文档查看。

暂无内容,可前往官方文档查看。

💡 使用小技巧

传入清晰图片可获得更精准结果。