LlamaMetaMoE旗舰 开源模型

Llama 4 Maverick 4 Maverick

Llama 4 Maverick系列 · Meta AI · 2025-04发布

开源支持本地部署多模态国内可直连有免费额度长上下文代码专用

模型介绍

Llama 4 旗舰开源版,128 专家 MoE、17B 激活/400B 总参数,对标 GPT-4o,推理成本仅为十分之一,原生多模态与最长 1M 上下文。

模型基础信息

模型系列Llama 4 Maverick系列
开发机构Meta AI
发布时间2025-04
参数规模400B(17B 激活)MoE
上下文窗口1M
模型类型多模态(文本+图像)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

社区许可免费商用。

收费标准简介

本地零成本(需多卡)。

模型能力介绍

✅ 核心优势

  • 开源最强档
  • 多模态
  • 1M 上下文
  • 性价比

⚠️ 短板与局限

  • 显存需求高
  • 中文一般

🎯 适用场景

  • 开源旗舰
  • 多模态
  • gent
  • 私有化

模型使用教程

本章节整理 Llama 4 Maverick 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run llama-4-maverick 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run llama-4-maverick "用中文介绍一下Llama 4 Maverick"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Meta AI/Llama 4 Maverick --local-dir ./llama-4-maverick

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('Meta AI/Llama 4 Maverick')
tok = AutoTokenizer.from_pretrained('Meta AI/Llama 4 Maverick')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

Llama 4 Maverick 是 Meta 开源的旗舰 MoE(400B 总参,激活 17B),多模态,Apache-2.0,需多卡部署。

  1. vLLM 多卡:

pip install vllm && vllm serve meta-llama/Llama-4-Maverick-17B-128E-Instruct --tensor-parallel-size 8 --port 8000

  1. 个人体验建议走托管 API(Together/Bedrock/Groq)。
  2. 本地小显存请改用 Scout 或 Llama 3.3。

Tips:400B 全量需 8×80GB;MoE 激活仅 17B,推理成本相对可控。

💡 使用小技巧

需要 4×24GB+ 显存,走 vLLM。

❓ 常见问题 FAQ

Q1:Maverick vs Scout?\nA1:Maverick 更强更贵。

访问备注与注意事项