HF开源推理服务器生产 本地部署模型

HuggingFace TGI TGI 3.x

Text Generation Inference系列 · HuggingFace · 2023-01发布

开源支持本地部署国内可直连有免费额度长上下文

模型介绍

HF 官方文本生成推理服务器,生产级大模型部署,支持量化、批处理与流式输出,OpenAI 兼容 API。

模型基础信息

模型系列Text Generation Inference系列
开发机构HuggingFace
发布时间2023-01
参数规模推理服务器(大模型)
上下文窗口可配
模型类型推理服务器
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 免费自托管。

收费标准简介

完全免费(自托管)。

模型能力介绍

✅ 核心优势

  • 生产级
  • 流式输出
  • 量化与批处理
  • HF 生态

⚠️ 短板与局限

  • 配置较复�
  • 资源要求高
  • 新手上手难

🎯 适用场景

  • 生产推理
  • PI 服务
  • 企业部署
  • 量化加速

模型使用教程

本章节整理 HuggingFace TGI 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地工具,安装后即可使用。
  • 支持对接主流模型与本地推理引擎。

启动服务后按提示操作即可。

export HF_ENDPOINT=https://hf-mirror.com

模型权重通过 HuggingFace 镜像或 ModelScope 下载。

提供 HTTP API:

curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'

TGI(Text Generation Inference)是高吞吐推理服务器,支持许多开源模型,Docker 一条命令部署。

  1. Docker 部署(示例 Llama 3.1):

docker run --gpus all -p 8080:80 ghcr.io/huggingface/text-generation-inference:latest --model-id meta-llama/Llama-3.1-8B-Instruct

  1. 调用 OpenAI 兼容接口:

curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"meta-llama/Llama-3.1-8B-Instruct","messages":[{"role":"user","content":"你好"}]}'

Tips:国内下载权重先 export HF_ENDPOINT=https://hf-mirror.com;支持量化加速与批处理。

💡 使用小技巧

docker run 一行启动。

❓ 常见问题 FAQ

Q1:TGI 是干嘛的?\nA1:生产级推理服务器。

访问备注与注意事项