본문으로 건너뛰기

GPU Offload

GPU 오프로드

모델의 연산 레이어를 CPU 대신 GPU 메모리에 할당하여 처리하는 기법으로, 할당량이 높을수록 추론 속도가 빨라진다.