본문으로 건너뛰기

강화학습(RL) 확장을 위한 Fireworks의 훈련 및 추론 통합 플랫폼

Fireworks가 RL의 핵심인 롤아웃과 훈련 루프를 통합하여 처리량, 동기화 속도, 수치적 일관성을 동시에 해결하는 플랫폼 기술을 공개했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

강화학습(RL)은 매 단계마다 새로운 가중치로 샘플을 생성하는 롤아웃 과정이 포함되어 훈련과 추론이 하나의 루프로 통합되는 구조적 특징을 갖는다. Fireworks는 이 과정에서 발생하는 병목을 해결하기 위해 비동기 RL로 GPU 활용도를 높이고, 전체 모델 대신 변경된 부분만 전송하는 델타 체크포인트 방식으로 가중치 동기화 속도를 10배 개선했다. 또한 훈련과 추론 엔진 간의 수치적 차이를 줄이기 위해 커널 구현을 맞추고 KLD 체크 및 라우터 리플레이 기술을 적용하여 모델의 안정성을 확보했다. 개발자는 보상 함수와 루프만 작성하면 플랫폼이 복잡한 인프라와 정렬 작업을 대신 처리하여 수 주가 걸리던 반복 주기를 수 시간으로 단축한다.

챕터별 상세

00:00

RL의 새로운 패러다임: 훈련과 추론의 통합

강화학습(RL)은 체크포인트를 훈련한 뒤 배포하는 기존의 선형적인 파이프라인 방식을 완전히 바꾼다. 매 훈련 단계는 모델 가중치를 이용해 수천 개의 답변을 생성하는 롤아웃으로 시작하며, 이 가중치는 매 단계마다 업데이트된다. 따라서 추론 엔진이 훈련 루프 내부에 위치하게 되며, 대규모 RL을 성공시키기 위해서는 롤아웃 처리량, 가중치 동기화, 수치적 정확성(Correctness) 세 가지 요소를 최적화해야 한다. Fireworks는 이 루프 전체를 하나의 플랫폼으로 통합하여 인프라 복잡성을 해결했다.
01:18

비동기 RL을 통한 GPU 활용도 극대화

동기식 RL 구조에서는 롤아웃 GPU가 훈련기의 업데이트를 기다리고, 훈련기는 다음 배치를 기다리며 GPU 자원이 낭비된다. 비동기 RL(Async RL)은 훈련과 롤아웃 수집 과정을 겹쳐서 실행하여 GPU 유휴 시간을 제거한다. 훈련기가 가중치를 업데이트하는 동안 롤아웃 GPU는 약간 이전 버전의 가중치를 사용해 다음 배치를 미리 생성하는 방식을 선택할 수 있다. 이를 통해 전체 시스템의 처리량을 높이고 GPU 활용률을 극대화하여 학습 비용을 절감한다.

비동기 방식에서는 가중치의 신선도(Staleness)와 처리량 사이의 트레이드오프가 발생하지만, 적절한 범위 내에서는 학습 속도를 크게 높일 수 있다.

01:51

델타 체크포인트를 활용한 고속 가중치 동기화

매 단계마다 수십 GB에 달하는 전체 모델 가중치를 복사하는 방식은 네트워크 병목을 일으켜 확장이 불가능하다. Fireworks는 첫 단계에서만 전체 베이스 스냅샷을 전송하고, 이후에는 XOR diff와 ZSTD 압축을 적용한 델타 체크포인트만 전송한다. 이 기법을 통해 실제 전송되는 데이터양을 기존 대비 약 10배 줄였다. 추론 복제본은 배포를 재시작하지 않고 메모리 상에서 즉시 가중치를 업데이트(In-place update)하여 동기화 지연을 최소화한다.
02:37

훈련과 추론 간의 수치적 일관성 확보 기술

훈련 엔진과 추론 엔진의 코드 경로가 다르면 동일한 가중치에서도 미세한 수치 차이가 발생하여 학습이 불안정해진다. Fireworks는 BF16, FP8 등 수치 포맷을 종단 간 일치시키고 커널 구현까지 동일하게 맞춰 수치적 발산을 방지한다. 훈련과 추론 간의 KL 발산(KLD)을 실시간으로 추적하여 정렬 상태를 감시한다. 특히 MoE 모델에서는 '라우터 리플레이' 기술을 도입하여 롤아웃 시 선택된 전문가가 훈련 시에도 동일하게 선택되도록 강제함으로써 모델의 안정성을 확보했다.

수치적 일관성이 깨지면 모델의 성능 지표인 Eval 점수뿐만 아니라 학습 자체의 수렴이 어려워질 수 있다.

03:42

Fireworks 플랫폼을 통한 RL 워크플로우 단순화

개발자는 복잡한 롤아웃 스케줄링이나 가중치 동기화 인프라를 직접 구축할 필요 없이 보상 함수와 훈련 루프 작성에만 집중할 수 있다. Fireworks Training 플랫폼이 체크포인트 관리, 가중치 업데이트, 훈련-추론 정렬 작업을 모두 자동화하여 제공한다. 이를 통해 수 주가 소요되던 모델 반복 주기를 수 시간 단위로 단축할 수 있다. 연구자는 데이터 레시피 튜닝과 하이퍼파라미터 선정과 같은 본질적인 과제에 더 많은 시간을 할애할 수 있게 된다.

용어 해설

강화학습(Reinforcement Learning)
에이전트가 환경과 상호작용하며 보상을 극대화하는 방향으로 행동을 학습하는 기법이다. LLM에서는 인간의 피드백을 반영하거나 추론 능력을 강화하는 데 사용되며, 훈련 과정 중에 모델이 직접 답변을 생성(롤아웃)하고 이를 평가하는 루프가 반복된다.
롤아웃(Rollout)
강화학습 훈련 과정에서 현재 모델 가중치를 사용하여 샘플 답변을 생성하는 단계이다. 훈련 루프 내에서 추론 엔진이 작동해야 하므로 대규모 학습 시 병목 구간이 되기 쉬우며, 생성된 샘플의 품질과 양이 학습 성능에 직접적인 영향을 미친다.
가중치 동기화(Weight Sync)
훈련기에서 업데이트된 최신 모델 파라미터를 롤아웃을 수행하는 추론 엔진으로 전달하는 과정이다. 모델 크기가 커질수록 네트워크 전송 부하가 심해지며, 동기화 속도가 느려지면 GPU가 유휴 상태에 빠져 전체 학습 효율이 저하된다.
KL 발산(KLD)
두 확률 분포 사이의 차이를 측정하는 지표이다. 강화학습에서는 훈련 엔진과 추론 엔진이 동일한 가중치에서도 서로 다른 수치를 내놓는 '수치적 발산'을 감시하기 위해 사용하며, 이 값이 커지면 학습의 안정성이 깨졌음을 의미한다.
전문가 혼합 모델(Mixture of Experts)
모든 파라미터를 사용하는 대신 입력에 따라 일부 전문가(Expert) 네트워크만 활성화하는 아키텍처이다. 강화학습 시 롤아웃과 훈련 단계에서 라우터가 서로 다른 전문가를 선택하면 학습이 불안정해지므로 일관성 유지가 매우 중요하다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 01.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.