通义 Qwen3.8-2.4T-A95B 3.8-2.4T-A95B
Qwen3.8-2.4T系列 · 阿里巴巴通义千问 · 2026-08发布
模型介绍
阿里首次开放的 Qwen-Max 级开源权重,2.4T 总参 / 激活 95B 稀疏 MoE,原生 262K 上下文可扩展 1M,必须开启思考模式,编程与长程 Agent 能力大幅提升。
模型基础信息
免费额度与收费政策
免费规则详情
Qwen 平台提供免费测试额度;权重开源可自部署(需企业级集群)。
收费标准简介
开源权重免费;云端 API 按量计费(以千问平台为准)。
模型能力介绍
✅ 核心优势
- 首个开放权重的 Qwen-Max 级模型
- 2.4T 总参 / 95B 激活
- 262K→1M 长上下文
- 编程与长程 Agent 领先
⚠️ 短板与局限
- 仓库体积约 4.89TB
- 需多节点企业级集群
- thinking 不可关闭
🎯 适用场景
- 复杂编程与代码生成
- 专业办公与科研
- 长周期 Agent 任务
- 私有化大模型底座
模型使用教程
本章节整理 通义 Qwen3.8-2.4T-A95B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:通过阿里云百炼 / Qwen Studio 调用,或下载权重(ModelScope / Hugging Face)部署。
- 能力简介:阿里首次开放的 Qwen-Max 级开源权重,2.4T 总参 / 激活 95B 稀疏 MoE,原生 262K 上下文可扩展至 1M,编程与长程 Agent 任务能力大幅提升。
- 适用场景:复杂编程、专业办公、科研、长周期 Agent 任务。
- 使用建议:该模型为纯文本,必须开启思考模式(thinking 不可关闭),支持 xhigh/medium/low 三档推理强度。
- 开发接入:官方推荐 SGLang / vLLM / TokenSpeed;API 见千问平台。
- 访问 [ModelScope](https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B) 或 [Hugging Face](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B) 下载。
- 仓库体积约 4.89TB,务必使用 git-lfs 或 modelscope 下载工具分片拉取。
- 该模型需企业级推理集群,个人设备建议使用云端 API。
from openai import OpenAI
client = OpenAI(base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
api_key="YOUR_DASHSCOPE_KEY")
resp = client.chat.completions.create(
model="qwen3.8-2.4t-a95b",
messages=[{"role": "user", "content": "帮我梳理这份代码库的模块依赖"}],
extra_body={"enable_thinking": True, "preserve_thinking": True},
reasoning_effort="xhigh",
)
print(resp.choices[0].message.content)
> 提示:本地部署时改用 vLLM/SGLang 且传入 chat_template_kwargs 开启 thinking。
- 部署方式:开源权重,推荐 SGLang / vLLM / TokenSpeed。
- 硬件要求:2.4T 总参 / 95B 激活,需多节点 H100/H200 集群;建议 FP8 量化与专家并行。
- 建议配置:推理内容最大输出设 262,144 tokens,最终回复设 131,072 tokens;temperature=1.0、top_p=0.95、top_k=20。
💡 使用小技巧
官方推荐 SGLang / vLLM / TokenSpeed;建议 FP8 量化与专家并行;temperature=1.0、top_p=0.95、top_k=20。
❓ 常见问题 FAQ
Q1:必须开启思考吗?
A1:是,支持 xhigh/medium/low 三档推理强度。
Q2:个人设备能跑吗?
A2:需企业级集群,个人建议用云端 API。
访问备注与注意事项
- 2026-08-12 权重在 Hugging Face 开放,随附 FP8 构建
Aitishiku.com