본문으로 건너뛰기

expert-parallel

전문가 병렬

EP는 MoE의 전문가 집합을 여러 GPU에 분산해 각 GPU가 일부 전문가만 소유하도록 하는 분할 방식이다. Wide-EP는 전문가 수를 노드·GPU에 넓게 퍼뜨려 각 토큰당 활성 파라미터를 줄이는 대신 노드 간 소통 비중을 높인다. EP 차수가 증가할수록 모든-대-모든(all-to-all) 통신 횟수와 메시지 수가 급증해 통신이 병목이 된다.