TensorRT 从 0 到 1 安装教程:pip 一行跑通,再到 trtexec 验证引擎
【免费下载链接】TensorRTNVIDIA® TensorRT™ is an SDK for high-performance deep learning inference on NVIDIA GPUs. This repository contains the open source components of TensorRT.项目地址: https://gitcode.com/GitHub_Trending/tens/TensorRT
你手里有一个 PyTorch 或 TensorFlow 训练好的模型,想部署到 NVIDIA GPU 上跑生产环境——TensorRT 就是这个把模型编译成可序列化推理引擎的 SDK。这篇 TensorRT 安装与环境配置教程只带你走最快路径:一条 pip 命令装上运行时,一条 trtexec 命令验证引擎真的能跑起来。
TensorRT 帮你省掉的事
| 痛点 | TensorRT 的解法 |
|---|---|
| 框架模型直接推理慢 | ONNX/PyTorch 模型转成优化后的 engine plan,层融合 + 算子优化 |
| 显存和带宽吃紧 | FP16 / INT8 低精度推理,精度可按模型调 |
| 没有现成工具测性能 | 内置 trtexec,一条命令出延迟和吞吐 |
| 自定义算子不支持 | 开源仓库自带 plugin/ 目录下的标准插件(ROIAlign、NMS、Attention 等) |
| 模型导入踩坑 | Polygraphy 调试 ONNX 图,逐层对输出找差异 |
5 分钟环境自检:版本对照表
动手前先对版本,这是 TensorRT 新手教程里报错最多的环节。TRT 11.x 只认 CUDA 13.x,装错 cuDNN/CUDA 版本后面全是坑:
| 组件 | 最低要求 | 推荐版本 |
|---|---|---|
| 操作系统 | Ubuntu 22.04 / Rocky Linux 8+ | Ubuntu 24.04 x86_64 |
| CUDA Toolkit | 12.9.0 | 13.3.0 |
| cuDNN(可选) | 8.9 | 8.9 |
| Python | 3.10 | 3.10–3.14 |
| cmake | 3.31 | 最新稳定版 |
| make / git / pkg-config | make ≥ 4.1 | 系统自带即可 |
| TensorRT GA 库 | 11.1.0.106 | 11.1.0.106 |
两条路线:先 pip 跑通,再决定要不要源码构建
第 1 步:pip 安装 Python 运行时。只写 Python 推理应用的话,这一步就够了,后面构建章节可以直接跳过:
pip install tensorrt装完立刻验证,应打印11.x.x版本号且无报错:
python3 -c "import tensorrt; print(tensorrt.__version__)"第 2 步(仅源码构建需要):拉取开源组件。这个仓库包含 ONNX parser、插件库和全部 sample,不含闭源核心库:
git clone -b main https://gitcode.com/GitHub_Trending/tens/TensorRT TensorRT cd TensorRT && git submodule update --init --recursive验证点:目录里应能看到include/、samples/、plugin/三个目录,版本号在 VERSION 文件中(当前 11.1.0.106)。
第 3 步:下载 TensorRT GA 包并导出库路径。闭源核心库要单独从 NVIDIA 开发者站下载对应 CUDA 版本的 tar 包,解压后指向lib目录:
export TRT_LIBPATH=`pwd`/TensorRT-11.1.0.106/lib验证点:该目录下应存在libnvinfer.so.*系列动态库。
第 4 步:cmake 生成工程并编译。⚠️ 这里最容易漏TRT_LIB_DIR,漏了会报找不到NvInferVersion.h:
mkdir -p build && cd build cmake .. -DTRT_LIB_DIR=$TRT_LIBPATH -DTRT_OUT_DIR=`pwd`/out make -j$(nproc)验证点:输出目录build/out下生成trtexec、libnvinfer_plugin.so等产物。想省掉本机装依赖,可以直接用仓库自带的 docker/ 构建容器,一条./docker/build.sh出镜像。
trtexec 验证与两个高频报错
最小验证命令——拿一个 ONNX 模型(比如 Polygraphy 示例)直接转引擎,看到&&&& PASSED即安装成功:
./out/trtexec --onnx=model.onnx报错 1:NvInferVersion.h not foundcmake 阶段报这个,说明TRT_LIB_DIR指向的目录里没有../include/NvInferVersion.h。检查 GA 包是否解压完整,必要时加-DTRT_INCLUDE_DIR=你的头文件目录显式指定。
报错 2:import tensorrt失败或版本冲突两类原因:一是-cu12和-cu13的 wheel 混装,TRT 11.x 只搭配 cu13,先pip uninstall tensorrt再重装;二是系统里存在多个 TensorRT,用python3 -c "import tensorrt; print(tensorrt.__file__)"看加载路径,必要时设置LD_LIBRARY_PATH指向 GA 包的lib。
下一步往哪走
到这里,你的 TensorRT 环境已经能编译并验证推理引擎了。接下来按场景走:import_workflows.md 覆盖 ONNX、Torch-TensorRT、HuggingFace 四条导入路径的完整步骤和坑点;supported_models.md 给出各模型类型的支持矩阵;想亲手写 C++ 推理程序,从 quickstart/SemanticSegmentation 的教程开始,版本更新细节见 CHANGELOG.md。
【免费下载链接】TensorRTNVIDIA® TensorRT™ is an SDK for high-performance deep learning inference on NVIDIA GPUs. This repository contains the open source components of TensorRT.项目地址: https://gitcode.com/GitHub_Trending/tens/TensorRT
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考