본문으로 건너뛰기
PyTorch조회 1

Miles, RadixArk의 대규모 LLM RL 포스트트레이닝 프레임워크

Miles는 SGLang, Megatron-LM, Ray, PyTorch를 결합해 MoE와 저정밀도 환경에서 대규모 LLM의 RL 포스트트레이닝을 분산 시스템 수준에서 재현 가능하고 확장성 있게 운영할 수 있게 한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

대규모 LLM의 RL post-training은 모델 확장과 MoE, 다양한 하드웨어·저정밀도 환경으로 인해 분산 시스템 문제로 확장되었다. Miles는 SGLang을 통한 고처리량 롤아웃, Megatron-LM 기반의 확장형 훈련, Ray 오케스트레이션, PyTorch 수치 계층을 결합한 오픈소스 프레임워크로서 작은 코어와 플러그형 엣지로 사용자 확장을 허용한다. 통합된 저정밀도 레시피와 MoE-aware rollout/training 정합성, NCCL/RDMA 기반의 빠른 가중치 동기화, 관측성 및 내결함성 기능을 포함해 대규모 LLM RL 작업의 재현성과 운영성을 개선하도록 설계되었다. 다만 본문은 구체적 벤치마크 수치나 구현 예제 대신 아키텍처 구성요소와 설계 목표를 중심으로 기술하였다.

섹션별 상세

01
대규모 LLM의 RL post-training 단계는 단순한 학습 루프를 넘어 분산 시스템 문제로 확장되었다. 롤아웃(worker)에서 고처리량 샘플을 생성하고 훈련 트레이너가 이를 안정적으로 소비하며 정책과 라우팅 행동을 동기화해야 한다는 요구가 동시에 존재한다. MoE 모델의 라우팅 비헤이비어와 하드웨어·저정밀도 설정의 다양성 때문에 개별 구성요소의 불일치는 학습 안정성과 재현성에 악영향을 미칠 수 있다. 따라서 롱런 잡에서의 관측성, 체크포인팅, 내결함성은 설계 초기부터 포함되어야 한다고 글에서 정리되었다.
02
Miles의 아키텍처는 작고 확장 가능한 코어와 런타임에 플러그인 방식으로 사용자 모듈을 붙이는 'small-core, many-edges' 철학을 채택했다. 구체적으로 롤아웃은 SGLang으로 고처리량 샘플 생성을 담당하고, 분산 훈련은 Megatron-LM이 처리하며 Ray가 클러스터 오케스트레이션과 액터 수명주기를 관리하고 PyTorch가 공통 수치 및 확장성 계층을 제공한다. 이 구성은 사용자 정의 롤아웃 로직, 보상 계산, 손실 함수, 샘플 필터링, 메트릭과 훅을 런타임에 붙여 변경 가능하게 하여 프레임워크 포크 없이 알고리즘 실험과 운영 요구를 충족하도록 설계되었다. 또한 글에서는 MoE-aware rollout/training alignment, 통합된 저정밀도 레시피, NCCL/RDMA 기반의 빠른 weight 동기화, 관측성 및 내결함성이 내장되어 있다고 명시되어 이러한 요소들이 대규모 RL 작업의 재현성과 운영성을 개선한다고 결론을 내렸다.

용어 해설

Mixture-of-Experts(Mixture-of-Experts (MoE))
MoE는 모델 내부에 여러 전문가(expert) 서브네트워크를 두고 입력에 따라 라우팅하여 일부 전문가만 활성화시킴으로써 계산 효율을 높이는 구조이다. 라우터는 토큰을 적절한 전문가로 분배하고 그 결과를 집계하여 출력하며 대규모 모델에서 계산과 파라미터 효율을 개선한다. 본문에서는 MoE 모델의 라우팅 동작을 rollout과 training 간에 일치시켜야 하는 문제점 맥락에서 중요하다고 다루었다.
SGLang
SGLang은 고처리량 롤아웃(rollout) 생성을 지원하도록 설계된 런타임/라이브러리로서 다수의 샘플을 병렬로 생성하면서 지연과 처리량을 최적화한다. Miles는 SGLang을 롤아웃 계층의 핵심으로 사용하여 샘플 생성 파이프라인의 처리량을 확보했다. 기사에서는 SGLang이 고속 롤아웃을 담당한다고 명시되어 있다.
Megatron-LM
Megatron-LM은 대규모 분산 학습을 위해 모델 병렬화와 통신 최적화를 제공하는 학습 프레임워크로서 대형 Transformer 계열 모델의 스케일아웃에 적합하다. Miles는 Megatron-LM을 훈련 엔진으로 통합하여 대규모 분산 업데이트를 처리하도록 구성했다. 본문에서는 Megatron-LM이 확장형 훈련을 담당한다고 명시되어 있다.
NCCL/RDMA
NCCL은 GPU 간 고속 통신 라이브러리이고 RDMA는 네트워크 수준에서 CPU 개입을 최소화하는 직접 메모리 접근 기술로서 대용량 가중치 동기화의 지연을 줄인다. Miles는 이 조합을 통해 빠른 weight synchronization을 구현하여 분산 훈련 병목을 완화한다. 기사에서는 NCCL/RDMA 기반의 빠른 동기화가 내장되었다고 밝혔다.
저정밀도 레시피(Low-Precision Recipes)
저정밀도 레시피는 훈련과 추론 과정에서 dtype 변환, 스케일링, 옵티마이저 조정 등을 결합해 float32 대신 float16/int8 수준의 표현을 안정적으로 활용하는 기법 묶음이다. Miles는 파이프라인 전반에서 일관된 저정밀도 동작을 보장하는 레시피를 제공하여 메모리와 연산 효율을 개선한다. 본문에서는 unified low-precision recipes가 파이프라인 전반에서 작동해야 한다고 지적했다.

기술

  • SGLang
  • Megatron-LM
  • Ray
  • PyTorch
  • NCCL/RDMA
  • MoE

활용 사례

  • LLM RL post-training
  • 대규모 분산 롤아웃과 훈련 파이프라인 운영
  • MoE 모델의 포스트트레이닝에서 라우팅 정합성 유지
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 01.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.