본문으로 건너뛰기

moe-offloading

MoE 오프로딩

MoE Offloading은 자주 선택되는 활성 전문가를 VRAM에 배치하고 나머지 전문가 가중치를 시스템 RAM에 두는 메모리 배치 방식입니다. GPU 메모리가 제한된 환경에서도 큰 모델을 실행하는 대신 CPU와 메모리 전송 비용을 감수합니다.