본문으로 건너뛰기

tensorrt-fp16

TensorRT FP16

TensorRT FP16은 GPU 상에서 FP16(half-precision)을 이용해 추론을 실행하는 런타임 설정을 가리킵니다. 이미지 상단에 '14.8 ms @ threshold 0.80'로 표기된 지연수치는 동일 입력에서 FP16 기반 추론이 기록한 처리 시간을 보여줍니다. FP16 연산은 메모리 대역폭과 연산량을 낮춰 레이턴시를 줄이는 목적에 사용됩니다.