본문으로 건너뛰기

분산 환경에서 RL 학습 효율을 높이는 Stitch 프로토콜

RL 학습 시 분산된 GPU 환경에서 대용량 체크포인트 전송 없이 500MB 수준의 패치만으로 가중치를 동기화하는 Stitch 프로토콜을 소개한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

RL 학습은 고속 통신이 필요한 all-reduce 구조 때문에 단일 클러스터에 종속적이다. 하지만 GPU 자원이 분산된 환경에서는 대용량 체크포인트 전송이 병목이 된다. Stitch 프로토콜은 Adam 옵티마이저의 작은 업데이트가 정밀도 한계(finite precision) 내에서 흡수된다는 점을 이용해, 실제 변경된 1% 미만의 가중치만 패치 형태로 전송한다. 이를 통해 500GB의 체크포인트 대신 500MB의 데이터만으로도 비트 단위로 동일한 모델을 재구성하여, 추론 엔진을 클러스터 외부로 분산 배치할 수 있다.

챕터별 상세

00:00

RL 학습의 클러스터 종속성 문제

RL 학습은 고속 통신이 필수적인 all-reduce 구조를 사용하여 단일 클러스터에 종속된다. 하지만 GPU 자원은 전 세계에 흩어져 있어, 500GB에 달하는 체크포인트를 매번 전송하는 것은 학습 효율을 저해한다. 분산된 GPU 환경에서 체크포인트 전체를 전송하지 않고 필요한 패치만 동기화하여 학습을 수행하는 Stitch 프로토콜이 대안으로 제시된다.
06:33

Stitch 프로토콜의 핵심 원리

Stitch 프로토콜은 전체 체크포인트 대신 1% 미만의 변경된 가중치만 전송한다. 그래디언트가 희소(sparse)해서가 아니라, Adam 옵티마이저의 업데이트 값이 정밀도 한계(finite precision) 내에서 흡수되기 때문이다. 롤아웃 엔진이 서빙하는 BF16 가중치 뷰의 반올림 경계보다 Adam 업데이트 값이 훨씬 작아, 대부분의 가중치가 변경되지 않은 것으로 간주된다. 이를 Adam absorption이라 부르며, 이 원리를 이용해 500GB의 데이터를 500MB 수준으로 압축한다.

Adam absorption은 정밀도 한계로 인해 미세한 업데이트가 무시되는 현상을 의미한다.

13:05

FP8 및 NVFP4 정밀도와 스케일링

BF16 외에도 FP8, NVFP4 등 낮은 정밀도를 사용하는 롤아웃 엔진이 증가하고 있다. 정밀도가 낮아질수록 반올림 경계가 커져 Adam absorption 현상이 더 강하게 나타난다. 결과적으로 더 적은 수의 가중치만 변경되어, 롤아웃 엔진 간의 동기화 데이터 양이 추가로 감소한다.
15:06

Stitch 프로토콜 구조와 버전 관리

Stitch 프로토콜은 트레이너가 게시판(bulletin board)에 불변(immutable) 버전 정보를 게시하고, 롤아웃 엔진이 이를 풀(pull)하는 구조이다. 사이드카(sidecar)가 롤아웃 엔진의 버전 인지 능력을 담당하여, 엔진이 최신 버전이 아니면 자동으로 업데이트를 적용하거나 요청을 프록시한다. 이를 통해 롤아웃 엔진은 트레이너와 물리적으로 분리된 환경에서도 비트 단위로 동일한 모델을 재구성한다.
18:42

향후 과제와 결론

Muon 옵티마이저 등 다른 알고리즘에서도 동일한 희소성(sparsity)이 유지되는지, 비동기 RL 학습으로의 확장 가능성, 그리고 사전 학습(pre-training) 및 SFT(Supervised Fine-Tuning) 단계로의 일반화가 향후 연구 과제이다. Stitch 프로토콜은 추론 용량을 RL 학습 용량으로 전환하여, 클러스터 제약 없이 전 세계의 GPU를 활용하는 탄력적인 롤아웃 플릿을 가능하게 한다.

용어 해설

Adam 흡수(Adam Absorption)
Adam 옵티마이저의 업데이트 값이 정밀도 한계(finite precision) 내에 존재하여, 실제 가중치 값에 영향을 주지 않고 무시되는 현상이다. 이로 인해 롤아웃 엔진이 서빙하는 가중치 뷰에서 변경 사항이 거의 발생하지 않는다.
올리듀스(All-Reduce)
분산 학습 시 여러 GPU의 그래디언트를 합치고 결과를 다시 분배하는 통신 연산이다. 고속 네트워크(fast fabric)가 필수적이며, 이로 인해 학습 루프가 단일 클러스터에 강하게 결합된다.
롤아웃 엔진(Rollout Engine)
RL 학습 루프에서 정책을 사용하여 환경과 상호작용하고 궤적(trajectory)을 생성하는 추론 엔진이다. Stitch 프로토콜을 통해 학습 클러스터 외부로 분산 배치된다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 11.수집 2026. 08. 11.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.