Inference Benchmarks

Measured throughput for RF-DETR, YOLOv8, ResNet, and ViT models on NVIDIA L4 and Jetson Orin NX, comparing ONNX and TensorRT.

This page contains performance benchmarks for various models running with Inference on different hardware platforms.

NVIDIA L4 GPU

Object detection

Performance benchmarks for object detection models, comparing standard ONNX runtime with TensorRT-optimized adapters:

Model TypeSizeInference/sec (ONNX)Inference/sec (TRT)Improvement Multiplier
rfdetr-nano384x384103.5299.52.9
rfdetr-small512x51257.4253.44.4
rfdetr-medium576x57662.8201.83.2
rfdetr-large704x70436.9160.54.3
rfdetr-xlarge700x70018.196.15.3
rfdetr-2xlarge880x88017.474.14.3

Segmentation

Performance benchmarks for instance segmentation models:

Model TypeSizeInference/sec (ONNX)Inference/sec (TRT)Improvement Multiplier
rfdetr-seg-nano312x31251.9105.32.0
rfdetr-seg-small384x38457.5126.72.2
rfdetr-seg-medium432x43239.799.72.5
rfdetr-seg-large504x50432.893.22.8
rfdetr-seg-xlarge624x6241768.84.0
rfdetr-seg-2xlarge768x76810.7595.5

Classification

Performance benchmarks for classification models:

Model TypeSizeInference/sec (ONNX)Inference/sec (TRT)Improvement Multiplier
ResNet50224x224358.6600.81.7
ViT224x224238306.51.3

Jetson Orin NX

Object detection

Performance benchmarks for object detection models on Jetson Orin NX:

Model TypeSizeInference/sec (ONNX)Inference/sec (TRT)Improvement Multiplier
rfdetr-nano384x38421.278.53.7
rfdetr-small512x51213.952.53.8
rfdetr-medium576x57611444.0
yolov8n-640640x64035.6892.5
yolov8s-640640x64026.369.52.6
yolov8m-640640x64013.544.53.3
yolov8l-640640x640932.53.6
yolov8x-640640x6406.4223.4

Benchmark methodology

All benchmarks were conducted using the Inference CLI, with a single image (batch size 1, -bs 1) over 500 iterations (-bi 500).

  • Inference/sec (ONNX) - standard ONNX runtime, measured with:

    inference benchmark python-package-speed -m [model]
  • Inference/sec (TRT) - TensorRT-optimized adapters (supported in inference 1.0 and later), measured with:

    USE_INFERENCE_MODELS=TRUE inference benchmark python-package-speed -m [model]