InternVL(开源视觉) InternVL 2.5
InternVL系列 · 上海人工智能实验室 · 2023-12发布
模型介绍
InternVL 是开源视觉语言模型,中文视觉问答与图文理解强,多尺寸覆盖,学术与商用皆可。
模型基础信息
免费额度与收费政策
免费规则详情
MIT 许可可商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 中文视觉强
- 多尺寸
- 图文理解好
- MIT
⚠️ 短板与局限
- 视频理解弱于新模型
- 生态较新
- 需显卡
🎯 适用场景
- 视觉问答
- OCR
- 文档理解
- 多模态 Agent
模型使用教程
本章节整理 InternVL(开源视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
上传图片/表格/文档,进行视觉问答、OCR 与图表理解。
# 多模态输入:图片 base64 + 文本问题
注册 上海人工智能实验室 账号获取 API Key。
export API_KEY=sk-xxxx
curl -F image=@test.png -F prompt="图片里有什么?"
InternVL 提供多种尺寸,推荐从 InternVL2-8B 起步(约 12GB 显存)。
- 安装依赖:
pip install "transformers>=4.37.2" torchvision einops timm。 - 用 transformers 直接推理(权重 hf-mirror 可下):
python -c "from transformers import AutoModel, AutoTokenizer; m=AutoModel.from_pretrained('OpenGVLab/InternVL2-8B', trust_remote_code=True).cuda(); t=AutoTokenizer.from_pretrained('OpenGVLab/InternVL2-8B', trust_remote_code=True); print(m.chat(t, '描述这张图', [Image.open('x.jpg')]))"
- 大显存场景可用 LMDeploy/vLLM 部署成 OpenAI 兼容 API:
vllm serve OpenGVLab/InternVL2-8B --trust-remote-code
Tips:中文图文问答/OCR 直接信任 remote_code 即可,无需额外训练。
💡 使用小技巧
中文图文理解开源首选。
❓ 常见问题 FAQ
Q1:InternVL 强在哪?\nA1:中文视觉语言。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com