NVIDIA开源推理高性能 本地部署模型

TensorRT-LLM TensorRT-LLM 0.14

TensorRT系列 · NVIDIA · 2023-11发布

开源支持本地部署国内可直连有免费额度长上下文

模型介绍

TensorRT-LLM 是 NVIDIA 的高性能推理引擎,基于 TensorRT,FP8/权重量化极限加速,DataCenter GPU 顶级吞吐。

模型基础信息

模型系列TensorRT系列
开发机构NVIDIA
发布时间2023-11
参数规模推理引擎(TensorRT)
上下文窗口可配
模型类型推理引擎
中文能力
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 免费。

收费标准简介

完全免费(自托管)。

模型能力介绍

✅ 核心优势

  • 行业顶级吞吐
  • FP8 支持
  • TensorRT 加速
  • NVIDIA 生态

⚠️ 短板与局限

  • 仅 NVIDIA 卡
  • 编译复�
  • 学习成本高

🎯 适用场景

  • 数据中心推理
  • 高性能服务
  • 量化加速
  • 企业

模型使用教程

本章节整理 TensorRT-LLM 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地工具,安装后即可使用。
  • 支持对接主流模型与本地推理引擎。

启动服务后按提示操作即可。

export HF_ENDPOINT=https://hf-mirror.com

模型权重通过 HuggingFace 镜像或 ModelScope 下载。

提供 HTTP API:

curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'

TensorRT-LLM 是 NVIDIA 的高性能推理引擎,面向 NVIDIA GPU 极致加速,适合生产高并发。

  1. Docker 镜像部署:

docker run --gpus all -it --shm-size=2g nvcr.io/nvidia/tensorrt_llm:latest

  1. 编译模型(示例 Llama):

python examples/llama/convert_checkpoint.py --model_dir meta-llama/Llama-3.1-8B-Instruct --output_dir ckpt && trtllm-build --checkpoint_dir ckpt --output_dir engine

  1. 启动 OpenAI 兼容服务:

python examples/llama/run_server.py --engine_dir engine --max_batch_size 64

Tips:仅支持 NVIDIA GPU(建议 RTX/数据中心卡);加速收益在长序列与大并发最明显。

💡 使用小技巧

A100/H100 发挥最佳。

❓ 常见问题 FAQ

Q1:TensorRT-LLM 特点?\nA1:极限推理性能。

访问备注与注意事项