본문으로 건너뛰기

AMD GPU에서 veRL 강화학습 후학습 가동

ROCm과 AITER를 결합한 veRL이 AMD GPU에서 GRPO·DAPO 후학습의 정확도와 비동기 처리량을 입증했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AMD의 veRL이 ROCm 기반 turnkey container와 AITER-가속 vLLM·SGLang rollout을 갖춘 형태로 AMD Instinct GPU에서 강화학습 후학습을 실행합니다. MI300과 MI355 계열에서 GRPO, DAPO, PPO 구성을 colocated와 fully-async 방식으로 운용한 결과, Qwen3-8B는 GSM8K 약 95.5%와 MATH 약 83.9%에 도달했고 Qwen2.5-Math-7B의 DAPO는 최대 0.34 정확도로 veRL 기준 결과와 비슷한 수준을 기록했습니다. 같은 32개 GPU를 사용한 Qwen2.5-Math-7B 실험에서 fully-async는 colocated보다 학습 단계 시간이 약 1.8배 짧았으며, Qwen3.5-35B-A3B MoE에서는 GPU당 처리량이 약 1.4배 높았습니다. 다만 긴 reasoning 응답이 후반부에 약 890토큰에서 약 1,850토큰으로 늘면서 DAPO 단계 시간이 600~1,200초 범위로 상승하는 현상도 관찰됐습니다.

섹션별 상세

01
AMD 환경에서 강화학습 후학습 스택을 구성할 때 ROCm과 PyTorch, Triton, vLLM, SGLang, AITER, TransformerEngine, Megatron-core의 버전과 커널을 각각 맞춰야 하는 부담이 컸습니다. veRL은 verlai/verl:rocm7.14_torch2.12_release_0724 container에 이 런타임을 함께 고정해 데이터만 mount하고 docker run으로 GRPO, DAPO, PPO 학습을 시작하게 합니다. 이 이미지는 gfx942인 MI300 계열과 gfx950인 MI350 계열을 기본 대상으로 하며, 실제 AMD 하드웨어의 CI runner에서 저장소 변경을 시험해 환경 재현성과 배포 신뢰도를 높입니다.
02
rollout 단계는 강화학습 학습 속도와 샘플 품질을 좌우하므로 특정 추론 엔진 하나에 종속되지 않는 구성이 필요합니다. veRL은 ROCm에서 vLLM과 SGLang을 모두 연결하고, AITER가 attention, RMSNorm, RoPE, MoE, quantization kernel을 가속하도록 구성합니다. vLLM은 환경 변수로 AITER 경로를 활성화하고 SGLang은 AITER kernel을 기본 활성화하며, 두 엔진 모두 rollout과 training을 같은 GPU에서 수행하는 colocated와 GPU를 분리하는 fully-async 모드를 지원합니다.
03
MI350에서 SGLang rollout과 FSDP를 사용한 Qwen3-8B GRPO는 GSM8K validation accuracy가 0.82에서 약 0.955, 최고 0.956까지 상승했고 MATH는 0.37에서 약 0.835, 최고 0.839에 도달했습니다. group size n=5, 8 GPU 단일 노드, 최대 prompt·response 길이 1,024·2,048토큰 설정에서 평균 학습 보상도 0.62에서 약 0.90으로 함께 올라갔으며 actor/ppo_kl은 전체 실행 동안 약 1e-4에 머물렀습니다. 이는 AITER-가속 SGLang이 생성한 토큰의 확률과 FSDP actor가 재계산한 확률 사이의 차이가 매우 작아 SGLang rollout이 정확도를 훼손하지 않았다는 뜻입니다.
Qwen3-8B를 SGLang rollout과 FSDP로 학습한 GRPO 실험의 정확도, 보상, rollout과 actor 사이 KL, 단계별 시간을 함께 나타낸 그래프입니다.
ChartGSM8K 정확도는 약 0.95 이상에서 빠르게 안정되고 MATH 정확도는 약 0.84까지 점진적으로 상승하며, 평균 보상도 약 0.90에 접근합니다. Rollout과 actor 사이 KL은 0 부근의 매우 작은 값에 머물고 단계 시간은 초기 약 288초에서 이후 약 220~240초 범위로 낮아져 SGLang과 FSDP 사이의 수치 일치 및 안정적인 실행 흐름을 보여줍니다.
04
MI300에서 Qwen2.5-Math-7B DAPO를 16개 rollout GPU와 16개 training GPU로 fully-async 실행하자 MATH validation accuracy가 0.13에서 최고 0.34로 올라가고 평균 보상은 −0.98에서 +0.17로 상승했습니다. staleness_threshold=0.5와 partial_rollout 설정에서 actor/ppo_kl은 초기 약 100 logged step 동안 약 0.0007이었다가 stale sample이 사용된 뒤 0.15~0.25 수준으로 안정됐으며, 동일한 32 GPU의 colocated 실행보다 단계 시간이 중앙값 약 219초 대 약 394초로 약 1.8배 짧았습니다. 다만 후반부에는 정확도 개선 없이 평균 응답 길이가 약 890토큰에서 약 1,850토큰으로 늘어 단계 시간이 600~1,200초까지 증가했으며, 이는 학습 불안정보다 reasoning 응답 길이 증가에 따른 비용으로 제시됐습니다.
AMD MI300에서 Qwen2.5-7B DAPO를 16개 rollout GPU와 16개 training GPU로 fully-async 실행한 정확도, 보상, KL, 단계별 시간 그래프입니다.
ChartValidation accuracy는 약 0.13에서 최고 약 0.34로 상승하고 평균 보상은 −1.0 부근에서 약 0.17까지 개선됩니다. KL은 약 200 step 이후 0.1 이상으로 커지지만 대체로 0.15~0.25에 머물며, 단계 시간은 초반 약 190~250초에서 후반 최대 약 1,200초까지 증가해 긴 응답 길이가 비동기 학습 비용에 미치는 영향을 나타냅니다.
05
MI350에서 Megatron backend로 Qwen3.5-35B-A3B MoE를 geometry3k에 GRPO 후학습한 결과, colocated와 fully-async 모두 안정적인 수렴을 보였습니다. 두 방식은 validation accuracy를 약 0.37~0.48에서 첫 약 75 step 안에 약 0.77~0.78까지 끌어올렸고, 보상은 약 0.34에서 약 0.82로 상승했으며 rollout과 actor 사이 KL은 fully-async 약 0.001, colocated 약 0으로 유지됐습니다. fully-async는 GPU당 약 310 tok/s를 기록해 colocated의 약 216 tok/s보다 약 1.4배 높은 처리량을 냈고, 35B 파라미터 MoE에서도 비동기 분리가 정확도와 처리량을 함께 유지하는 구성을 만들었습니다.
AMD MI350에서 Qwen3.5-35B-A3B MoE를 GRPO 학습한 colocated와 fully-async 실행의 정확도, 보상, KL, GPU당 처리량 비교 그래프입니다.
Chart두 실행 방식 모두 geometry3k 정확도가 약 0.75~0.78 범위로 수렴하고 보상도 약 0.8 수준까지 올라가며, fully-async KL은 약 0.001, colocated KL은 0에 가깝습니다. 처리량 그래프에서는 fully-async가 대부분의 구간에서 colocated보다 높고 후반에도 약 310 tok/s/GPU 대 약 216 tok/s/GPU의 차이를 유지해 GPU 분리의 처리량 이점을 나타냅니다.

용어 해설

강화학습 후학습(Reinforcement Learning Post-Training)
사전학습이나 Fine-tuning을 마친 언어 모델을 보상 신호와 생성 결과를 이용해 추가로 최적화하는 과정입니다. 모델이 문제를 풀고 받은 보상을 기준으로 정책을 갱신하며, PPO·GRPO·DAPO 같은 알고리즘이 이 단계에 사용됩니다. 추론 엔진과 학습 엔진의 동기화 및 샘플 품질이 최종 성능에 직접 영향을 줍니다.
GRPO
여러 응답을 한 그룹으로 생성한 뒤 응답 간 상대적 보상을 이용해 언어 모델 정책을 업데이트하는 강화학습 알고리즘입니다. 별도의 가치 모델 의존성을 줄이고 그룹 내 보상 차이로 학습 신호를 구성합니다. 기사에서는 Qwen3-8B와 Qwen3.5-35B-A3B의 reasoning 후학습에 사용됐습니다.
DAPO
대규모 추론 모델의 강화학습 후학습에 사용되는 정책 최적화 방식으로, 비동기 rollout과 긴 응답 생성을 포함한 설정에서 학습을 수행합니다. rollout 엔진이 만든 샘플과 학습 정책 사이의 지연 및 KL 차이를 관리하면서 모델을 업데이트합니다. 기사에서는 Qwen2.5-Math-7B의 MATH 학습에 적용됐습니다.
완전 비동기 실행(Fully-Async Execution)
rollout과 모델 학습을 서로 다른 GPU 그룹에서 동시에 실행하고, 일정한 주기에 파라미터를 동기화하는 실행 방식입니다. rollout worker는 이전 정책으로 생성한 샘플을 계속 공급하고 학습 worker는 staleness_threshold 같은 조건에 따라 업데이트된 가중치를 전달받습니다. GPU 유휴 시간을 줄이는 대신 stale sample에 따른 정책 차이를 KL로 관리해야 합니다.
Rollout 엔진(Rollout Engine)
강화학습 중 현재 정책으로 입력에 대한 응답을 대량 생성하고 각 토큰의 확률 및 보상 계산에 필요한 샘플을 생산하는 실행 구성요소입니다. 기사에서는 vLLM과 SGLang이 rollout을 맡고 AITER kernel을 통해 attention, RMSNorm, RoPE, MoE, quantization 연산을 가속합니다. 생성 속도와 학습 정책과의 수치 일치도가 전체 후학습 효율을 좌우합니다.

기술

  • veRL
  • ROCm
  • PyTorch
  • Triton
  • vLLM
  • SGLang
  • AITER
  • TransformerEngine
  • Megatron-core
  • FSDP
  • FSDP2
  • Docker
  • MI300
  • MI300X
  • MI300A
  • MI308
  • MI325X
  • MI350
  • MI350X
  • MI355X
  • Qwen3-8B
  • Qwen2.5-Math-7B
  • Qwen3.5-35B-A3B

활용 사례

  • LLM 강화학습 후학습
  • GRPO 기반 수학·추론 모델 학습
  • DAPO 기반 긴 reasoning 응답 학습
  • AMD Instinct GPU에서 colocated 후학습
  • AMD Instinct GPU에서 fully-async 후학습
  • MoE 모델의 Megatron 기반 후학습
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.