moe-offloading
MoE 오프로딩
MoE Offloading은 자주 선택되는 활성 전문가를 VRAM에 배치하고 나머지 전문가 가중치를 시스템 RAM에 두는 메모리 배치 방식입니다. GPU 메모리가 제한된 환경에서도 큰 모델을 실행하는 대신 CPU와 메모리 전송 비용을 감수합니다.
MoE 오프로딩
MoE Offloading은 자주 선택되는 활성 전문가를 VRAM에 배치하고 나머지 전문가 가중치를 시스템 RAM에 두는 메모리 배치 방식입니다. GPU 메모리가 제한된 환경에서도 큰 모델을 실행하는 대신 CPU와 메모리 전송 비용을 감수합니다.