섹션별 상세
기존 ROFT 토폴로지는 Prefill-Decode 분리 추론 시 비대칭적인 KV Cache 전송으로 인해 특정 Leaf 스위치에 트래픽이 집중되는 문제가 발생한다. 이로 인해 PFC(Priority Flow Control) 백프레셔가 걸리며 대역폭 효율이 저하된다.
ZCube는 스파인 레이어를 완전히 제거하고 두 스위치 그룹 간 완전 이분 그래프(complete bipartite) 연결을 사용하여 네트워크를 재설계했다. 모든 GPU 쌍이 고유한 최적 경로를 가지게 되어, 라우팅 알고리즘에 의존하지 않고 토폴로지 자체에서 부하 분산이 이루어진다.

실제 1,000개 GPU 클러스터에서 GLM-5.1 모델로 테스트한 결과, 처리량은 15% 증가하고 P99 첫 토큰 지연 시간은 40% 감소했다. 또한 스위치와 광 모듈 비용을 33% 절감하여 성능 향상과 비용 절감을 동시에 달성했다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 29.수집 2026. 05. 29.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.