vLLM(高性能推理框架) v0.9
vLLM系列 · vLLM 社区 · 2023-02发布
模型介绍
业界最流行的 LLM 推理与部署框架,PagedAttention 显存优化、连续批处理,吞吐量可达普通推理的数倍,是生产环境部署的首选。
模型基础信息
免费额度与收费政策
免费规则详情
vLLM 完全开源免费,可自由部署与商用。
收费标准简介
软件免费;成本以 GPU 服务器硬件与电费为主。
模型能力介绍
✅ 核心优势
- PagedAttention 显存优化,吞吐量数倍于普通推理
- 一行命令启动 OpenAI 兼容生产服务
- 支持 AWQ / GPTQ 量化与多卡张量并行
- 社区活跃,适配主流开源模型
⚠️ 短板与局限
- 对显卡与 CUDA 环境有要�
- 需一定的工程运维能力
- 纯 CPU 场景不适用
🎯 适用场景
- 生产环境开源模型服务化
- 高并发 API 网关部署
- 企业私有化大模型平台
- 量化与多卡推理加速
模型使用教程
本章节整理 vLLM(高性能推理框架) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 适用:GPU 服务器(NVIDIA CUDA)、A100/H100 最佳。
- 单条命令启动 OpenAI 兼容服务,支持 Qwen、Llama、DeepSeek 等主流模型。
- 特性:PagedAttention 显存管理、流式输出、量化(AWQ/GPTQ)、多卡张量并行。
pip install vllm
vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000
要求:Python 3.9+,CUDA 11.8 / 12.1+。
pip install vllm
国内加速:
pip install vllm -i https://pypi.tuna.tsinghua.edu.cn/simple
启动后即 OpenAI 兼容:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"Qwen/Qwen2.5-7B-Instruct","messages":[{"role":"user","content":"你好"}],"max_tokens":128}'
环境:Python 3.9+,NVIDIA CUDA 11.8 / 12.1+。
pip install vllm
vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000
启动后即 OpenAI 兼容接口:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"Qwen/Qwen2.5-7B-Instruct","messages":[{"role":"user","content":"你好"}],"max_tokens":128}'
多卡并行加参数:--tensor-parallel-size 2。
💡 使用小技巧
常用启动:vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000。
显存紧张可加 --quantization awq 加载量化版。
❓ 常见问题 FAQ
Q1:vLLM 和 Ollama 怎么选?
A1:生产高并发选 vLLM,个人体验选 Ollama。
Q2:需要什么硬件?
A2:NVIDIA CUDA GPU(A100 / H100 / 4090 等),Python 3.9+。
访问备注与注意事项
- 国内安装可用清华 PyPI 镜像加速
- 文档以 GitHub 为主
Aitishiku.com