开源性能部署量化 开源模型

AWQ 量化 AWQ

AWQ(Activation-aware Weight Quantization系列 · MIT 科研团队 · 2023-06发布

开源支持本地部署国内可直连有免费额度

模型介绍

AWQ 是一种激活感知的权重量化方法,可将大模型 4-bit 量化几乎无损,显著降低显存与推理延迟,是部署利器。

模型基础信息

模型系列AWQ(Activation-aware Weight Quantization系列
开发机构MIT 科研团队
发布时间2023-06
参数规模量化工具(作用于任意模型)
上下文窗口
模型类型工具(量化)+ 量化模型
中文能力
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 完全自由商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 4-bit 近无损
  • 显存省一半
  • 速度提升
  • 生态广泛

⚠️ 短板与局限

  • 需要烧录/转换
  • 部分模型效果有损
  • 工具链有门槛

🎯 适用场景

  • 本地大模型
  • 边缘部署
  • 量化研究
  • 推理优化

模型使用教程

本章节整理 AWQ 量化 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run awq 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run awq "用中文介绍一下AWQ 量化"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download MIT 科研团队/AWQ(Activation-aware Weight Quantization) --local-dir ./awq

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('MIT 科研团队/AWQ(Activation-aware Weight Quantization)')
tok = AutoTokenizer.from_pretrained('MIT 科研团队/AWQ(Activation-aware Weight Quantization)')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

AWQ 是量化工具,作用是把大模型量化为 4bit,让显存减半、推理加速,量化后模型可直接用 vLLM 加载。

  1. 安装量化工具:

pip install autoawq

  1. 对模型做 AWQ 量化:

python -m awq.entry --model_path /path/to/llama2-7b --q_group_size 128 --zero_point true --dump_quant ./llama2-7b-awq

  1. 用 vLLM 加载量化后的模型:

vllm serve ./llama2-7b-awq --quantization awq --port 8000

Tips:也可直接下载社区量化好的 AWQ 权重(如 TheBloke 系列)省去量化步骤。

💡 使用小技巧

16GB 显存也能跑 70B 量化。

❓ 常见问题 FAQ

Q1:AWQ 干嘛的?\nA1:把模型量化到 4-bit 提速省显存。

访问备注与注意事项