TensorRT-LLM TensorRT-LLM 0.14
TensorRT系列 · NVIDIA · 2023-11发布
模型介绍
TensorRT-LLM 是 NVIDIA 的高性能推理引擎,基于 TensorRT,FP8/权重量化极限加速,DataCenter GPU 顶级吞吐。
模型基础信息
免费额度与收费政策
免费规则详情
Apache-2.0 免费。
收费标准简介
完全免费(自托管)。
模型能力介绍
✅ 核心优势
- 行业顶级吞吐
- FP8 支持
- TensorRT 加速
- NVIDIA 生态
⚠️ 短板与局限
- 仅 NVIDIA 卡
- 编译复�
- 学习成本高
🎯 适用场景
- 数据中心推理
- 高性能服务
- 量化加速
- 企业
模型使用教程
本章节整理 TensorRT-LLM 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地工具,安装后即可使用。
- 支持对接主流模型与本地推理引擎。
启动服务后按提示操作即可。
export HF_ENDPOINT=https://hf-mirror.com
模型权重通过 HuggingFace 镜像或 ModelScope 下载。
提供 HTTP API:
curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'
TensorRT-LLM 是 NVIDIA 的高性能推理引擎,面向 NVIDIA GPU 极致加速,适合生产高并发。
- Docker 镜像部署:
docker run --gpus all -it --shm-size=2g nvcr.io/nvidia/tensorrt_llm:latest
- 编译模型(示例 Llama):
python examples/llama/convert_checkpoint.py --model_dir meta-llama/Llama-3.1-8B-Instruct --output_dir ckpt && trtllm-build --checkpoint_dir ckpt --output_dir engine
- 启动 OpenAI 兼容服务:
python examples/llama/run_server.py --engine_dir engine --max_batch_size 64
Tips:仅支持 NVIDIA GPU(建议 RTX/数据中心卡);加速收益在长序列与大并发最明显。
💡 使用小技巧
A100/H100 发挥最佳。
❓ 常见问题 FAQ
Q1:TensorRT-LLM 特点?\nA1:极限推理性能。
访问备注与注意事项
- 需 NVIDIA GPU
Aitishiku.com