70BMeta开源本地部署 开源模型

Llama 3.3 3.3

Llama系列 · Meta AI · 2024-12发布

开源支持本地部署国内可直连有免费额度长上下文

模型介绍

Meta 在 Llama 3.1 基础上优化的 70B 模型,用更小规模达到接近 405B 的效果,推理成本大幅下降,是单卡 / 双卡可运行的顶级开源模型。

模型基础信息

模型系列Llama系列
开发机构Meta AI
发布时间2024-12
参数规模70B
上下文窗口128K
模型类型文本
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

开源权重免费商用,遵守 Llama 社区许可即可。

收费标准简介

本地零成本;托管按 token 计费。

模型能力介绍

✅ 核心优势

  • 70B 达到 405B 级别的能力
  • 成本远低于同性能闭源
  • 128K 长上下文
  • 工具调用完善

⚠️ 短板与局限

  • 72B 仍需较高显存
  • 中文略逊于国产同尺寸
  • 许可有附加条款

🎯 适用场景

  • 企业私有化基座
  • 长文档处理
  • gent 工作流
  • 高性价比自部署

模型使用教程

本章节整理 Llama 3.3 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

Llama 3.3 主打 70B 的成本获得接近 405B 的能力,适合作为企业私有化基座或省钱的自建方案。

  • 指令版(Instruct):开箱即用对话。
  • 基础版(Base):适合继续预训练 / 微调。
  1. 在 Hugging Face 同意 Llama 许可后下载:
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download meta-llama/Llama-3.3-70B-Instruct --local-dir ./llama33
ollama run llama3.3 "用中文写一段关于AI未来的话"

Llama 3.3 是 70B 的优化模型,用更小规模达到接近 405B 的效果,量化后双卡可跑。

  1. Ollama(需约 40GB+ 显存):

ollama pull llama3.3:70b(或先拉 8B 蒸馏版体验)

  1. vLLM 部署(70B):

pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct --port 8000 --tensor-parallel-size 2

  1. 低显存用 4bit/AWQ 量化版(社区 TheBloke 有现成权重)。

Tips:70B 全量约 140GB 显存,量化后约 35GB(2×24GB 或 1×48GB);推理成本低于 405B。

💡 使用小技巧

双卡 4090(Q4)即可运行 70B。

本地体验:ollama run llama3.3

❓ 常见问题 FAQ

Q1:和 Llama 3.1 70B 比强多少?

A1:明显更强,接近 405B 水平。

Q2:显存要多大?

A2:Q4 量化约 40GB。

访问备注与注意事项