Qwen多模态视觉阿里 开源模型

Qwen3-VL Qwen3-VL

Qwen3系列 · 阿里巴巴 · 2025-09发布

开源支持本地部署多模态国内可直连有免费额度长上下文代码专用

模型介绍

阿里开源 Qwen3 系列视觉语言模型,原生多模态理解,8B 量化后单卡可跑,OCR 与文档理解能力突出,Apache-2.0 可自由商用。

模型基础信息

模型系列Qwen3系列
开发机构阿里巴巴
发布时间2025-09
参数规模8B / 30B / 235B
上下文窗口128K
模型类型多模态(图像)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 自由商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 中文视觉强
  • OCR 优�
  • 开源
  • 端侧

⚠️ 短板与局限

  • 大版本需高显存

🎯 适用场景

  • OCR
  • 图文理解
  • 文档
  • 端侧

模型使用教程

本章节整理 Qwen3-VL 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run qwen3-vl 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run qwen3-vl "用中文介绍一下Qwen3-VL"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 阿里巴巴/Qwen3-VL --local-dir ./qwen3-vl

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('阿里巴巴/Qwen3-VL')
tok = AutoTokenizer.from_pretrained('阿里巴巴/Qwen3-VL')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

Qwen3-VL 是阿里开源的多模态视觉模型(8B/32B/235B),8B 量化后 16GB 显存可跑,OCR 与视频理解强。

  1. 安装依赖:

pip install -U transformers accelerate

  1. 用 transformers 加载(权重 hf-mirror 可下):

python -c "from transformers import AutoModelForCausalLM, AutoProcessor; m=AutoModelForCausalLM.from_pretrained('Qwen/Qwen3-VL-8B-Instruct', torch_dtype='float16').cuda(); p=AutoProcessor.from_pretrained('Qwen/Qwen3-VL-8B-Instruct')"

  1. vLLM 服务化(推荐,图片 base64 输入):

pip install vllm && vllm serve Qwen/Qwen3-VL-8B-Instruct --port 8000

  1. 或用 Ollama 直接体验:

ollama pull qwen3-vl && ollama run qwen3-vl

Tips:8B 约需 16GB 显存,4bit 量化可降至 8GB;OCR、文档、视频问答是强项。

💡 使用小技巧

ollama pull qwen3-vl 体验。

❓ 常见问题 FAQ

Q1:Qwen3-VL 强项?\nA1:OCR 与视觉理解。

访问备注与注意事项