본문으로 건너뛰기

tensor-expert-parallelism

텐서 병렬성·전문가(Expert) 병렬성

텐서 병렬성은 하나의 연산을 여러 GPU로 샤딩해 계산하는 반면, 전문가 병렬성은 MoE 구조에서 각 전문가를 GPU에 배치해 라우터로 동작을 분배하는 방식이다. 텐서 병렬은 고대역폭 NVLink 같은 빠른 인터커넥트가 필요하고 전문가 병렬은 라우팅과 메모리 경쟁을 줄여 처리량을 높인다. 실제 서비스에서는 두 기법을 혼용해 레이턴시와 처리량 목표를 맞춘다.