GLM-4中文开源智谱 开源模型

GLM-4-32B GLM-4-32B

GLM-4系列 · 智谱AI · 2025-08发布

开源支持本地部署国内可直连有免费额度长上下文代码专用

模型介绍

智谱面对开发者开放的中等规模开源模型,32B 参数能力均衡,128K 上下文,量化后单卡可跑,是中文开源基座的热门选择。

模型基础信息

模型系列GLM-4系列
开发机构智谱AI
发布时间2025-08
参数规模32B
上下文窗口128K
模型类型文本
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 自由商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 中文优�
  • pache-2
  • 128K
  • 单卡

⚠️ 短板与局限

  • 通用弱于旗舰

🎯 适用场景

  • 中文本地
  • 微调
  • 私有化
  • 知识库

模型使用教程

本章节整理 GLM-4-32B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run glm-4-32b 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run glm-4-32b "用中文介绍一下GLM-4-32B"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 智谱AI/GLM-4-32B --local-dir ./glm-4-32b

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('智谱AI/GLM-4-32B')
tok = AutoTokenizer.from_pretrained('智谱AI/GLM-4-32B')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

GLM-4-32B 是智谱开源的中等规模模型(Apache-2.0),128K 上下文,中文与工具调用强,单卡可部署。

  1. Ollama 一键:

ollama pull glm4

  1. 交互使用:

ollama run glm4

  1. vLLM 生产:

pip install vllm && vllm serve zai-org/GLM-4-32B --trust-remote-code --port 8000

  1. 低显存用 AWQ 4bit 量化(约 16GB)。

Tips:32B 全量 FP16 约 64GB,量化后 24GB 级即可;中文私有化首选之一。

💡 使用小技巧

ollama pull glm4:32b

❓ 常见问题 FAQ

Q1:GLM-4-32B 适合?\nA1:中文私有化。

访问备注与注意事项