ApacheMistralMoE开源 开源模型

Mixtral 8x22B 8x22B

Mixtral 8x22B系列 · Mistral AI · 2024-04发布

开源支持本地部署国内可直连有免费额度长上下文代码专用

模型介绍

Mistral 开源的大规模 MoE 模型,总参 141B 仅激活 39B,推理效率与性能兼备,Apache-2.0 可商用,多语言好。

模型基础信息

模型系列Mixtral 8x22B系列
开发机构Mistral AI
发布时间2024-04
参数规模141B(MoE,激活 39B)
上下文窗口64K
模型类型文本
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 完全商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • MoE 效率高
  • pache 商用
  • 多语�
  • 能力接近旗舰

⚠️ 短板与局限

  • 内存需求高
  • 生态小于 Llama
  • 中文一般

🎯 适用场景

  • 开源基座
  • 多语言应用
  • 企业私有化
  • 研究

模型使用教程

本章节整理 Mixtral 8x22B 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run mixtral-8x22b 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run mixtral-8x22b "用中文介绍一下Mixtral 8x22B"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Mistral AI/Mixtral 8x22B --local-dir ./mixtral-8x22b

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('Mistral AI/Mixtral 8x22B')
tok = AutoTokenizer.from_pretrained('Mistral AI/Mixtral 8x22B')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

Mixtral 8x22B 是 141B 的 MoE 模型(激活 39B),Apache-2.0,性能接近 70B 级,但部署门槛高。

  1. vLLM 多卡部署:

pip install vllm && vllm serve mistralai/Mixtral-8x22B-Instruct-v0.1 --tensor-parallel-size 4 --port 8000

  1. 低显存用 AWSQ/4bit(约 80GB):

使用 TheBloke/Mixtral-8x22B-Instruct-v0.1-GPTQ 量化版 + ExLlamaV2。

  1. Ollama 也可尝试(需足够内存与量化)。

Tips:MoE 推理速度快,多用户并发好;个人慎选,4bit 仍需大显存。

💡 使用小技巧

需要大内存(量化可用)。

❓ 常见问题 FAQ

Q1:Mixtral 是什么架构?\nA1:MoE 稀疏专家。

访问备注与注意事项