tensor-offloading
Tensor Offloading
모델의 일부 텐서를 GPU VRAM에 모두 올리지 않고 CPU 메모리로 옮겨 처리하는 방식입니다. 이 글에서는 12GB VRAM 노트북에서 27B 모델을 실행하기 위해 FFN 가중치를 CPU에 배치하고, GPU에는 일부 레이어를 남기는 구성으로 활용됩니다.
Tensor Offloading
모델의 일부 텐서를 GPU VRAM에 모두 올리지 않고 CPU 메모리로 옮겨 처리하는 방식입니다. 이 글에서는 12GB VRAM 노트북에서 27B 모델을 실행하기 위해 FFN 가중치를 CPU에 배치하고, GPU에는 일부 레이어를 남기는 구성으로 활용됩니다.