把 Hugging Face 模型跑到 TensorRT,过去绕不开 ONNX 导出。英伟达刚放出的 TensorRT Model Connect 公测版,把这段压成了两条命令。
TensorRT 是英伟达的推理加速库,ONNX 是通用模型交换格式。这层一失败,报错落在算子层面,跟模型代码对不上。
示例是把 Qwen3-0.6B 打成 bundle 跑起来,同一份产物还能被 C++ 接口加载。开源,Apache 2.0。
我的判断:收干净的是部署的胶水层,别读成性能提升。前提是 supported model,两条命令只对官方适配过的模型成立,不在列表就得自己补。
公测阶段,收益随模型和显卡变化。在 N 卡上做部署值得试,只调 API 的可以先放着。
#人工智能 #AI新手村 #大模型 #程序 #英伟达

