LMDeploy开源推理量化 本地部署模型

LMDeploy LMDeploy 0.6

LMDeploy系列 · 上海人工智能实验室 · 2023-07发布

开源支持本地部署国内可直连有免费额度长上下文

模型介绍

LMDeploy 是国产高性能推理框架,服务 Qwen、InternLM、Llama 等,INT4/8 量化与多模态支持,OpenAI 兼容。

模型基础信息

模型系列LMDeploy系列
开发机构上海人工智能实验室
发布时间2023-07
参数规模推理框架
上下文窗口可配
模型类型推理框架
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 免费。

收费标准简介

完全免费。

模型能力介绍

✅ 核心优势

  • 国产友好
  • 量化强
  • 多模态
  • OpenAI 兼容

⚠️ 短板与局限

  • 生态小于 vLLM
  • 需配置
  • 文档一般

🎯 适用场景

  • 国产模型部署
  • 量化推理
  • 本地服务
  • 研究

模型使用教程

本章节整理 LMDeploy 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地工具,安装后即可使用。
  • 支持对接主流模型与本地推理引擎。

启动服务后按提示操作即可。

export HF_ENDPOINT=https://hf-mirror.com

模型权重通过 HuggingFace 镜像或 ModelScope 下载。

提供 HTTP API:

curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'

LMDeploy 是面向国产模型(InternLM/Qwen 系)优化的推理框架,吞吐高、量化省显存。

  1. 安装:

pip install lmdeploy

  1. 起服务:

lmdeploy serve internlm/internlm2_5-7b-chat

  1. 或启动多模态推理(VLM):

lmdeploy serve qwen2.5-vl-7b-instruct

  1. 波浪号量化(w4a16)可显著降低显存:

lmdeploy lite auto_awq /path/model --work-dir ./w4a16

Tips:默认端口 23333(/v1/chat/completions);对 InternLM/vLLM 格式兼容好。

💡 使用小技巧

配 Qwen/InternLM 最佳。

❓ 常见问题 FAQ

Q1:LMDeploy 特点?\nA1:国产推理框架。

访问备注与注意事项