开源模型

通义 Qwen3.5-397B-A17B 3.5-397B-A17B

Qwen3.5-397B系列 · 阿里巴巴通义千问 · 2026-02发布

开源支持本地部署多模态国内可直连有免费额度长上下文代码专用

模型介绍

阿里发布的全球首个原生多模态 MoE 开源模型,397B 总参 / 激活 17B,性能比肩万亿参数 Qwen3-Max,推理吞吐最高提升 19 倍,支持 201 种语言。

模型基础信息

模型系列Qwen3.5-397B系列
开发机构阿里巴巴通义千问
发布时间2026-02
参数规模397B(MoE,激活 17B)
上下文窗口262K(可扩展 1M)
模型类型多模态(文本+图像+视频)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

Qwen Chat 免费 开源权重

免费规则详情

chat.qwen.ai 免费体验;权重 Apache-2.0 开源;百炼 API 按量计费。

收费标准简介

开源权重免费;百炼 API 按量计费(以价格页为准)。

模型能力介绍

✅ 核心优势

  • 原生多模态 MoE
  • 17B 激活,推理高效
  • 262K→1M 超长上下文
  • 201 种语言支持

⚠️ 短板与局限

  • 总参 397B 部署门槛高
  • 视觉编码需配套
  • 多模态能力需 VLM 组件配合

🎯 适用场景

  • 多模态理解
  • GUI 智能体
  • 超长上下文处理
  • 企业私有化部署

模型使用教程

本章节整理 通义 Qwen3.5-397B-A17B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:在 [Qwen Chat](https://chat.qwen.ai) 选择 Qwen3.5 系列体验;开源权重可本地部署。
  • 能力简介:阿里除夕发布的全球首个原生多模态 MoE 大模型,397B 总参 / 激活 17B,性能比肩万亿参数的 Qwen3-Max,推理吞吐提升最高 19 倍。
  • 适用场景:多模态理解、GUI 智能体、超长上下文(1M)、企业级私有化。
  • 使用建议:支持 201 种语言;原生 262K 上下文可扩展至 1,010,000 tokens。
  • 开发接入:Hugging Face / ModelScope 下载权重,或通过阿里云百炼调用。
  1. 访问 [Hugging Face](https://huggingface.co/Qwen/Qwen3.5-397B-A17B) 或 [ModelScope](https://modelscope.cn/models/Qwen/Qwen3.5-397B-A17B) 下载。
  2. 权重体积大,使用 git-lfs:
git lfs install
git clone https://huggingface.co/Qwen/Qwen3.5-397B-A17B
  1. 推理建议使用最新 vLLM / SGLang / TokenSpeed。

vLLM 启动

vllm serve Qwen/Qwen3.5-397B-A17B --served-model-name qwen3.5-397b

curl 调用

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen3.5-397b","messages":[{"role":"user","content":"分析这张图的布局结构"}],"temperature":0.7}'

Python 调用

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
    model="qwen3.5-397b",
    messages=[{"role": "user", "content": "用中文介绍你自己"}],
)
print(resp.choices[0].message.content)

> 提示:支持多模态输入(文本/图像/视频),图像视频可直接传入。

  • 部署方式:开源权重(Apache-2.0),支持 vLLM / SGLang / TokenSpeed。
  • 硬件要求:397B 总参 / 17B 激活,企业级部署需多卡 H100/A100;FP8/BF16 混合精度可显著降低显存。
  • 部署建议:采用视觉与语言解耦并行策略,参考官方 SGLang 配置;消费级可借助量化或云端 Serverless GPU。

💡 使用小技巧

原生 262K 上下文可扩展至 1,010,000 tokens;用最新 vLLM / SGLang / TokenSpeed 推理。

❓ 常见问题 FAQ

Q1:有免费使用渠道吗?

A1:chat.qwen.ai 可免费体验。

Q2:支持视频输入吗?

A2:支持,文本/图像/视频均可输入。

访问备注与注意事项