본문으로 건너뛰기

tensor-offloading

Tensor Offloading

모델의 일부 텐서를 GPU VRAM에 모두 올리지 않고 CPU 메모리로 옮겨 처리하는 방식입니다. 이 글에서는 12GB VRAM 노트북에서 27B 모델을 실행하기 위해 FFN 가중치를 CPU에 배치하고, GPU에는 일부 레이어를 남기는 구성으로 활용됩니다.