中文开源推理阿里 开源模型

Qwen3 3

Qwen系列 · 阿里巴巴通义千问 · 2025-04发布

开源支持本地部署国内可直连有免费额度长上下文

模型介绍

阿里通义千问的第三代开源旗舰,引入混合推理(思考/非思考双模式)与 MoE 架构,全尺寸 0.6B 到 235B,中文与多语言能力强,Apache-2.0 可自由商用。

模型基础信息

模型系列Qwen系列
开发机构阿里巴巴通义千问
发布时间2025-04
参数规模0.6B ~ 235B(MoE)
上下文窗口256K
模型类型文本
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费 云 API 按量付费

免费规则详情

权重 Apache-2.0 完全免费商用;百炼云端按 token 计费,新用户有赠送额度。

收费标准简介

百炼 qwen3 系列按 token 计费(以百炼控制台价格页为准)。

模型能力介绍

✅ 核心优势

  • 思考 / 非思考双模式混合推理
  • MoE 架构成本效益好
  • 256K 长上下文
  • 中文开源能力第一梯队

⚠️ 短板与局限

  • 235B MoE 自部署显存高
  • 多模态需单独用 Qwen-VL
  • 生态仍在建设

🎯 适用场景

  • 开源基座与私有化部署
  • 复杂推理任务
  • 长文档处理
  • gent 与工具调用

模型使用教程

本章节整理 Qwen3 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

Qwen3 支持「思考 / 非思考」两种模式,非思考模式响应快,思考模式推理深,可按需切换。

云端体验:通义 App / 网页版选择 Qwen3。

# 本地
ollama pull qwen3
# 或 HuggingFace
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Qwen/Qwen3-8B --local-dir ./qwen3-8b
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://dashscope.aliyuncs.com/compatible-mode/v1")
resp = client.chat.completions.create(
    model="qwen3-8b",
    messages=[{"role": "user", "content": "用中文介绍Qwen3"}],
)
print(resp.choices[0].message.content)

Qwen3 是阿里最新开源旗舰(0.6B~235B MoE),性能登顶开源榜,MoE 版吞吐高。

  1. Ollama 一键(小尺寸):

ollama pull qwen3:8bollama pull qwen3:30b

  1. 使用:

ollama run qwen3:8b

  1. MoE 生产(0.6B/4B 密集版或 30B-A3B MoE):

pip install vllm && vllm serve Qwen/Qwen3-8B --port 8000

Tips:235B-A22B 有高吞吐与低成本 MoE 优势,但需多卡;个人先上 8B/30B MoE。

💡 使用小技巧

本地轻量体验用 Qwen3-4B 或 8B。

深度推理场景开启 thinking 模式。

❓ 常见问题 FAQ

Q1:Qwen3 和 Qwen2.5 区别?

A1:Qwen3 引入混合推理与 MoE,整体能力更强。

Q2:可以商用吗?

A2:Apache-2.0,放心商用。

访问备注与注意事项