본문으로 건너뛰기

Expert Streaming

Expert 스트리밍

Sparse MoE 모델에서 토큰마다 선택된 Expert의 가중치만 GPU 메모리로 전송하고 처리가 끝나면 다음 Expert를 불러오는 실행 방식입니다. Kimi K3를 3.72GB VRAM에서 실행한 근거가 이 방식과 연결됩니다.