Qwen2.5(通义千问开源版) 2.5
Qwen系列 · 阿里巴巴通义千问 · 2024-09发布
模型介绍
阿里通义千问开源系列,全尺寸覆盖 0.5B~72B,支持 128K 上下文,Apache-2.0 协议可自由商用,中文能力一流,是国内开源生态最完整的模型家族。
模型基础信息
免费额度与收费政策
免费规则详情
权重 Apache-2.0 完全免费、可自由商用;阿里云百炼新用户通常可领取免费 token 额度(以官方活动为准,超额后按量计费)。
收费标准简介
百炼 qwen-plus 约 ¥0.8 / 百万输入 token,qwen-turbo 更低;本地部署零成本。
模型能力介绍
✅ 核心优势
- 中文能力处于开源第一梯队
- 全尺寸覆盖 0.5B ~ 72B,选择丰富
- 128K 长上下文 + 支持工具调用
- pache-2.0 协议商用无限制
⚠️ 短板与局限
- 极端复杂推理弱于顶级闭源模型
- 72B 自建硬件门槛较高
- 多模态能力需单独使用 Qwen-VL 系列
🎯 适用场景
- 中文客服与智能问答
- 企业知识库检索增强(RAG)
- 手机 / 边缘设备端侧模型
- 代码辅助与信息抽取
模型使用教程
本章节整理 Qwen2.5(通义千问开源版) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 70B+(Qwen2.5-72B):能力最强,适合复杂推理与业务底座,建议用 vLLM 部署。
- 7B~14B:性价比之选,单张 24GB 显存即可运行,适合对话、写作、信息抽取。
- 0.5B~3B:轻量级,可跑手机/边缘设备,适合意图识别等简单任务。
- 通义官网体验:chat.qwen.ai;云上调用走「阿里云百炼」。
推荐用 transformers 或 vLLM 加载,教程见下方调用章节。
从 Hugging Face 下载(国内建议镜像):
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Qwen/Qwen2.5-7B-Instruct --local-dir ./qwen2.5-7b
Ollama 一键获取:
ollama pull qwen2.5:7b
云端 API:注册「阿里云百炼」→ 创建 API-KEY,模型名填 qwen-plus / qwen-max 等。
百炼 OpenAI 兼容接口
curl https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"qwen-plus","messages":[{"role":"user","content":"你好"}]}'
Python(transformers)
from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("./qwen2.5-7b")
model = AutoModelForCausalLM.from_pretrained("./qwen2.5-7b", device_map="auto")
ids = tok("你好", return_tensors="pt").input_ids
print(tok.decode(model.generate(ids, max_new_tokens=64)[0], skip_special_tokens=True))
Qwen2.5(0.5B~72B)是目前开源中文最强的系列之一,128K 上下文,7B 量化后 8GB 显存即可运行。
- Ollama 一键:
ollama pull qwen2.5:7b && ollama run qwen2.5:7b
- transformers 加载:
python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; m=AutoModelForCausalLM.from_pretrained('Qwen/Qwen2.5-7B-Instruct', device_map='auto'); t=AutoTokenizer.from_pretrained('Qwen/Qwen2.5-7B-Instruct'); print(t.decode(m.generate(t('你好', return_tensors='pt').input_ids, max_new_tokens=64)[0], skip_special_tokens=True))"
- vLLM 生产:
pip install vllm && vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000
Tips:72B 全量约 140GB 显存,量化后可降一半;配合 Ollama + Open WebUI 体验最佳。
💡 使用小技巧
本地体验用 Ollama:ollama pull qwen2.5:7b。
云端推荐走阿里云百炼的 OpenAI 兼容接口,可与现有 SDK 无缝切换。
❓ 常见问题 FAQ
Q1:Qwen2.5 开源版和通义闭源版什么关系?
A1:同源技术,开源版可自部署与微调;闭源版走百炼云 API,省心但有调用费用。
Q2:7B 需要多大显存?
A2:FP16 约 16GB,Q4 量化后 6GB 左右即可流畅运行。
访问备注与注意事项
- 权重国内可直连下载(ModelScope 镜像)
- 模型名需区分 Instruct(对话版)与 Base(基座版)
Aitishiku.com