Llama 3.1 3.1
Llama系列 · Meta AI · 2024-07发布
模型介绍
Meta 开源的旗舰大语言模型,405B 版本达到闭源旗舰级水平,8B/70B 可在消费级显卡量化运行,是最广泛使用的开源基座之一。
模型基础信息
免费额度与收费政策
免费规则详情
开源权重完全免费,遵守 Llama 社区许可即可自由商用;本地部署零授权成本,仅需自备显卡。
云端托管按 token 计费,无固定免费额度。
收费标准简介
云端托管约 $0.80 / 百万输入 token(Azure / Groq 等;以各平台价格页为准);自建成本取决于硬件。
模型能力介绍
✅ 核心优势
- 405B 旗舰能力可对标闭源大模型,成本极低
- 8B / 70B 量化后可在消费级显卡运行
- 128K 长上下文,适合长文档处理
- 工具调用(function calling)与多语言支持完善
⚠️ 短板与局限
- 中文表现略逊于国内同尺寸模型
- 405B 显存要求极高,个人只能走云 API
- 许可协议附有附加条款,超大商用规模需 Meta 额外授权
🎯 适用场景
- 企业私有化基座模型
- 长文档总结与 RAG 知识库
- 边缘设备轻量推理(8B 量化)
模型使用教程
本章节整理 Llama 3.1 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
Llama 3.1 提供 8B、70B、405B 三个尺寸,选择原则:
- 8B:轻量、响应快,适合边缘设备与简单任务,量化后可在 8GB 显存运行。
- 70B:综合能力均衡,A100/H100 或 2×4090 可运行,适合大多数业务场景。
- 405B:旗舰能力,适合最苛刻的生成任务,通常由云厂商提供。
官方全家桶包括:基础版(Base,用于微调续写)、指令版(Instruct,开箱即用的对话)、防滥版(Guard)与文本转语音版(Audio)。
- 到 Hugging Face 申请访问权限(需同意 Llama 协议),搜索
meta-llama/Llama-3.1-8B-Instruct。 - 用
huggingface-cli下载:
huggingface-cli download meta-llama/Llama-3.1-8B-Instruct --local-dir ./llama-3.1-8b
- 国内镜像可用
HF_ENDPOINT=https://hf-mirror.com加速下载。 - 亦可通过 Ollama 一行命令获取:
ollama pull llama3.1。
Transformers(PyTorch)
from transformers import pipeline
pipe = pipeline("text-generation", model="meta-llama/Llama-3.1-8B-Instruct")
res = pipe("请用一句话介绍大语言模型", max_new_tokens=64)
print(res[0]["generated_text"])
Ollama 命令行
ollama run llama3.1 "用中文写一首关于秋天的短诗"
OpenAI 兼容接口(通过 vLLM 启动后)
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"meta-llama/Llama-3.1-8B-Instruct","messages":[{"role":"user","content":"你好"}]}'
Llama 3.1 提供 8B / 70B / 405B 三档,8B 量化后 8GB 显存可跑,405B 个人几乎不可行建议走云 API。
- Ollama 一键运行 8B(最简单):
ollama pull llama3.1:8b && ollama run llama3.1:8b
- vLLM 生产部署:
pip install vllm && vllm serve meta-llama/Llama-3.1-8B-Instruct --port 8000
- 低显存用 AWQ/GGUF 量化版(社区 TheBloke 有现成权重);70B 量化约需 35GB 显存。
Tips:128K 长上下文;启动后是 OpenAI 兼容接口,curl http://localhost:8000/v1/chat/completions 即可调用。
💡 使用小技巧
用 Ollama 一行体验:ollama run llama3.1。
显存紧张时优先选择 AWQ / GGUF 量化版(如 Q4_K_M),70B 也能在 48GB 显存跑起来。
❓ 常见问题 FAQ
Q1:8B、70B、405B 怎么选?
A1:简单快速选 8B;效果优先且有 24GB+ 显存选 70B;追求顶尖能力选 405B(走云 API)。
Q2:可以商用吗?
A2:可以,但月活超 7 亿的设备需联系 Meta 获得额外授权。
访问备注与注意事项
- 权重下载国内可用 hf-mirror 镜像加速
- 无官方中文客服,以社区文档为主
- 官方建议配合 Guard 模型做内容风控
Aitishiku.com