GLM-4中文开源智谱 开源模型
GLM-4-32B GLM-4-32B
GLM-4系列 · 智谱AI · 2025-08发布
模型介绍
智谱面对开发者开放的中等规模开源模型,32B 参数能力均衡,128K 上下文,量化后单卡可跑,是中文开源基座的热门选择。
模型基础信息
模型系列GLM-4系列
开发机构智谱AI
发布时间2025-08
参数规模32B
上下文窗口128K
模型类型文本
中文能力优秀
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源免费
免费规则详情
Apache-2.0 自由商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 中文优�
- pache-2
- 128K
- 单卡
⚠️ 短板与局限
- 通用弱于旗舰
🎯 适用场景
- 中文本地
- 微调
- 私有化
- 知识库
模型使用教程
本章节整理 GLM-4-32B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地体验:
ollama run glm-4-32b或 Transformers / vLLM 加载。 - 云端:HF 托管模型可在线体验。
ollama run glm-4-32b "用中文介绍一下GLM-4-32B"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 智谱AI/GLM-4-32B --local-dir ./glm-4-32b
或 ModelScope 国内直连下载。
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('智谱AI/GLM-4-32B')
tok = AutoTokenizer.from_pretrained('智谱AI/GLM-4-32B')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))
GLM-4-32B 是智谱开源的中等规模模型(Apache-2.0),128K 上下文,中文与工具调用强,单卡可部署。
- Ollama 一键:
ollama pull glm4
- 交互使用:
ollama run glm4
- vLLM 生产:
pip install vllm && vllm serve zai-org/GLM-4-32B --trust-remote-code --port 8000
- 低显存用 AWQ 4bit 量化(约 16GB)。
Tips:32B 全量 FP16 约 64GB,量化后 24GB 级即可;中文私有化首选之一。
💡 使用小技巧
ollama pull glm4:32b。
❓ 常见问题 FAQ
Q1:GLM-4-32B 适合?\nA1:中文私有化。
访问备注与注意事项
- hf-mirror 可下
Aitishiku.com