AWQ 量化 AWQ
AWQ(Activation-aware Weight Quantization系列 · MIT 科研团队 · 2023-06发布
模型介绍
AWQ 是一种激活感知的权重量化方法,可将大模型 4-bit 量化几乎无损,显著降低显存与推理延迟,是部署利器。
模型基础信息
免费额度与收费政策
免费规则详情
MIT 完全自由商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 4-bit 近无损
- 显存省一半
- 速度提升
- 生态广泛
⚠️ 短板与局限
- 需要烧录/转换
- 部分模型效果有损
- 工具链有门槛
🎯 适用场景
- 本地大模型
- 边缘部署
- 量化研究
- 推理优化
模型使用教程
本章节整理 AWQ 量化 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地体验:
ollama run awq或 Transformers / vLLM 加载。 - 云端:HF 托管模型可在线体验。
ollama run awq "用中文介绍一下AWQ 量化"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download MIT 科研团队/AWQ(Activation-aware Weight Quantization) --local-dir ./awq
或 ModelScope 国内直连下载。
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('MIT 科研团队/AWQ(Activation-aware Weight Quantization)')
tok = AutoTokenizer.from_pretrained('MIT 科研团队/AWQ(Activation-aware Weight Quantization)')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))
AWQ 是量化工具,作用是把大模型量化为 4bit,让显存减半、推理加速,量化后模型可直接用 vLLM 加载。
- 安装量化工具:
pip install autoawq
- 对模型做 AWQ 量化:
python -m awq.entry --model_path /path/to/llama2-7b --q_group_size 128 --zero_point true --dump_quant ./llama2-7b-awq
- 用 vLLM 加载量化后的模型:
vllm serve ./llama2-7b-awq --quantization awq --port 8000
Tips:也可直接下载社区量化好的 AWQ 权重(如 TheBloke 系列)省去量化步骤。
💡 使用小技巧
16GB 显存也能跑 70B 量化。
❓ 常见问题 FAQ
Q1:AWQ 干嘛的?\nA1:把模型量化到 4-bit 提速省显存。
访问备注与注意事项
- OpenMMLab 有官方库
Aitishiku.com