中文大语言模型开源阿里 开源模型

Qwen2.5(通义千问开源版) 2.5

Qwen系列 · 阿里巴巴通义千问 · 2024-09发布

开源支持本地部署国内可直连有免费额度长上下文

模型介绍

阿里通义千问开源系列,全尺寸覆盖 0.5B~72B,支持 128K 上下文,Apache-2.0 协议可自由商用,中文能力一流,是国内开源生态最完整的模型家族。

模型基础信息

模型系列Qwen系列
开发机构阿里巴巴通义千问
发布时间2024-09
参数规模0.5B ~ 72B
上下文窗口128K
模型类型文本
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费 云 API 按量付费(新用户有赠送额度)

免费规则详情

权重 Apache-2.0 完全免费、可自由商用;阿里云百炼新用户通常可领取免费 token 额度(以官方活动为准,超额后按量计费)。

收费标准简介

百炼 qwen-plus 约 ¥0.8 / 百万输入 token,qwen-turbo 更低;本地部署零成本。

模型能力介绍

✅ 核心优势

  • 中文能力处于开源第一梯队
  • 全尺寸覆盖 0.5B ~ 72B,选择丰富
  • 128K 长上下文 + 支持工具调用
  • pache-2.0 协议商用无限制

⚠️ 短板与局限

  • 极端复杂推理弱于顶级闭源模型
  • 72B 自建硬件门槛较高
  • 多模态能力需单独使用 Qwen-VL 系列

🎯 适用场景

  • 中文客服与智能问答
  • 企业知识库检索增强(RAG)
  • 手机 / 边缘设备端侧模型
  • 代码辅助与信息抽取

模型使用教程

本章节整理 Qwen2.5(通义千问开源版) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 70B+(Qwen2.5-72B):能力最强,适合复杂推理与业务底座,建议用 vLLM 部署。
  • 7B~14B:性价比之选,单张 24GB 显存即可运行,适合对话、写作、信息抽取。
  • 0.5B~3B:轻量级,可跑手机/边缘设备,适合意图识别等简单任务。
  • 通义官网体验:chat.qwen.ai;云上调用走「阿里云百炼」。

推荐用 transformersvLLM 加载,教程见下方调用章节。

从 Hugging Face 下载(国内建议镜像):

HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Qwen/Qwen2.5-7B-Instruct --local-dir ./qwen2.5-7b

Ollama 一键获取:

ollama pull qwen2.5:7b

云端 API:注册「阿里云百炼」→ 创建 API-KEY,模型名填 qwen-plus / qwen-max 等。

百炼 OpenAI 兼容接口

curl https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen-plus","messages":[{"role":"user","content":"你好"}]}'

Python(transformers)

from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("./qwen2.5-7b")
model = AutoModelForCausalLM.from_pretrained("./qwen2.5-7b", device_map="auto")
ids = tok("你好", return_tensors="pt").input_ids
print(tok.decode(model.generate(ids, max_new_tokens=64)[0], skip_special_tokens=True))

Qwen2.5(0.5B~72B)是目前开源中文最强的系列之一,128K 上下文,7B 量化后 8GB 显存即可运行。

  1. Ollama 一键:

ollama pull qwen2.5:7b && ollama run qwen2.5:7b

  1. transformers 加载:

python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; m=AutoModelForCausalLM.from_pretrained('Qwen/Qwen2.5-7B-Instruct', device_map='auto'); t=AutoTokenizer.from_pretrained('Qwen/Qwen2.5-7B-Instruct'); print(t.decode(m.generate(t('你好', return_tensors='pt').input_ids, max_new_tokens=64)[0], skip_special_tokens=True))"

  1. vLLM 生产:

pip install vllm && vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000

Tips:72B 全量约 140GB 显存,量化后可降一半;配合 Ollama + Open WebUI 体验最佳。

💡 使用小技巧

本地体验用 Ollama:ollama pull qwen2.5:7b

云端推荐走阿里云百炼的 OpenAI 兼容接口,可与现有 SDK 无缝切换。

❓ 常见问题 FAQ

Q1:Qwen2.5 开源版和通义闭源版什么关系?

A1:同源技术,开源版可自部署与微调;闭源版走百炼云 API,省心但有调用费用。

Q2:7B 需要多大显存?

A2:FP16 约 16GB,Q4 量化后 6GB 左右即可流畅运行。

访问备注与注意事项