CogVLM(开源视觉) CogVLM2
CogVLM系列 · 智谱(THUDM) · 2023-10发布
模型介绍
智谱开源 CogVLM 视觉语言模型,17B 参数在视觉问答与理解上表现优秀,中文图文理解强。
模型基础信息
免费额度与收费政策
免费规则详情
开源可商用(遵守许可)。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 图文理解强
- 中文好
- 开源
- 视觉问答
⚠️ 短板与局限
- 17B 需显卡
- 生态较小
- 长视频不支持
🎯 适用场景
- 视觉问答
- OCR
- 图表理解
- 多模态研究
模型使用教程
本章节整理 CogVLM(开源视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
上传图片/表格/文档,进行视觉问答、OCR 与图表理解。
# 多模态输入:图片 base64 + 文本问题
注册 智谱(THUDM) 账号获取 API Key。
export API_KEY=sk-xxxx
curl -F image=@test.png -F prompt="图片里有什么?"
CogVLM 17B 全精度约需 40GB 显存,量化后 16-24GB 可跑。
- 安装依赖:
pip install transformers==4.37.2 accelerate sentencepiece torchvision。 - 下载权重(THUDM/cogvlm2-llama3-chat-19B,hf-mirror 可下),加载:
python -c "from transformers import AutoModelForCausalLM, LlamaTokenizer; m=AutoModelForCausalLM.from_pretrained('THUDM/cogvlm2-llama3-chat-19B', trust_remote_code=True, torch_dtype='float16').cuda(); t=LlamaTokenizer.from_pretrained('THUDM/cogvlm2-llama3-chat-19B', trust_remote_code=True); print(m.chat(t,'这是什么?',[Image.open('x.jpg')]))"
- 大显存可用 vLLM 起 OpenAI 兼容服务,供业务对接。
Tips:官方 demo 脚本 basic_demo.py 可交互对话;显存紧张用 load_in_4bit。
💡 使用小技巧
中文视觉理解不错。
❓ 常见问题 FAQ
Q1:CogVLM 用途?\nA1:图文理解与 VQA。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com