Mistral低延迟开源轻量 闭源大模型·海外

Mistral Small 3 Small 3

Mistral Small系列 · Mistral AI · 2025-01发布

开源支持本地部署国内可直连有免费额度长上下文代码专用

模型介绍

Mistral 最新小尺寸高效模型,24B/30B 参数,Apache-2.0 开源,延迟低、性能强,支持本地部署,是轻量推理的最佳选择之一。

模型基础信息

模型系列Mistral Small系列
开发机构Mistral AI
发布时间2025-01
参数规模24B / 30B
上下文窗口128K
模型类型文本
中文能力一般
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费 API

免费规则详情

权重开源;API 按 token 计费。

收费标准简介

输入约 $0.1 / 百万 token(以官方为准)。

模型能力介绍

✅ 核心优势

  • 低延迟
  • 开源
  • pache-2
  • 性价比

⚠️ 短板与局限

  • 中文较弱
  • 能力非旗舰

🎯 适用场景

  • 轻量对话
  • 边缘
  • function calling

模型使用教程

本章节整理 Mistral Small 3 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run mistral-small-3 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run mistral-small-3 "用中文介绍一下Mistral Small 3"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Mistral AI/Mistral Small 3 --local-dir ./mistral-small-3

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('Mistral AI/Mistral Small 3')
tok = AutoTokenizer.from_pretrained('Mistral AI/Mistral Small 3')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

Mistral Small 3 是 Mistral 开源的小尺寸高效模型,Apache-2.0,24B 量化后单卡可跑,多语言与推理均衡。

  1. Ollama:

ollama pull mistral-small3

  1. 交互使用:

ollama run mistral-small3

  1. vLLM:

pip install vllm && vllm serve mistralai/Mistral-Small-3.1-24B-Instruct-2503 --port 8000

Tips:24B FP16 约 48GB,4bit 约 14GB;128K 上下文,看长文档/代码友好。

💡 使用小技巧

低延迟轻量场景首选。

❓ 常见问题 FAQ

Q1:Small 3 亮点?\nA1:超低延迟 + 开源。

访问备注与注意事项