올리듀스
분산 학습에서 각 GPU가 계산한 gradient를 집계해 모든 워커가 동일한 파라미터를 유지하도록 하는 통신 연산으로, 빈번한 동기화와 큰 통신량을 발생시킨다. 네트워크 성능 한계가 있을 때 AllReduce가 병목이 되어 GPU 유휴 시간이 늘어난다. 본문은 gradient 동기화 대기 때문에 GPU가 유휴 상태가 된다고 지적하고 있어 AllReduce 계열 통신 비용이 문제 지점임이 암시된다.