TL;DR
AMD의 veRL이 ROCm 기반 turnkey container와 AITER-가속 vLLM·SGLang rollout을 갖춘 형태로 AMD Instinct GPU에서 강화학습 후학습을 실행합니다. MI300과 MI355 계열에서 GRPO, DAPO, PPO 구성을 colocated와 fully-async 방식으로 운용한 결과, Qwen3-8B는 GSM8K 약 95.5%와 MATH 약 83.9%에 도달했고 Qwen2.5-Math-7B의 DAPO는 최대 0.34 정확도로 veRL 기준 결과와 비슷한 수준을 기록했습니다. 같은 32개 GPU를 사용한 Qwen2.5-Math-7B 실험에서 fully-async는 colocated보다 학습 단계 시간이 약 1.8배 짧았으며, Qwen3.5-35B-A3B MoE에서는 GPU당 처리량이 약 1.4배 높았습니다. 다만 긴 reasoning 응답이 후반부에 약 890토큰에서 약 1,850토큰으로 늘면서 DAPO 단계 시간이 600~1,200초 범위로 상승하는 현상도 관찰됐습니다.
섹션별 상세



용어 해설
- 강화학습 후학습(Reinforcement Learning Post-Training)
- — 사전학습이나 Fine-tuning을 마친 언어 모델을 보상 신호와 생성 결과를 이용해 추가로 최적화하는 과정입니다. 모델이 문제를 풀고 받은 보상을 기준으로 정책을 갱신하며, PPO·GRPO·DAPO 같은 알고리즘이 이 단계에 사용됩니다. 추론 엔진과 학습 엔진의 동기화 및 샘플 품질이 최종 성능에 직접 영향을 줍니다.
- GRPO
- — 여러 응답을 한 그룹으로 생성한 뒤 응답 간 상대적 보상을 이용해 언어 모델 정책을 업데이트하는 강화학습 알고리즘입니다. 별도의 가치 모델 의존성을 줄이고 그룹 내 보상 차이로 학습 신호를 구성합니다. 기사에서는 Qwen3-8B와 Qwen3.5-35B-A3B의 reasoning 후학습에 사용됐습니다.
- DAPO
- — 대규모 추론 모델의 강화학습 후학습에 사용되는 정책 최적화 방식으로, 비동기 rollout과 긴 응답 생성을 포함한 설정에서 학습을 수행합니다. rollout 엔진이 만든 샘플과 학습 정책 사이의 지연 및 KL 차이를 관리하면서 모델을 업데이트합니다. 기사에서는 Qwen2.5-Math-7B의 MATH 학습에 적용됐습니다.
- 완전 비동기 실행(Fully-Async Execution)
- — rollout과 모델 학습을 서로 다른 GPU 그룹에서 동시에 실행하고, 일정한 주기에 파라미터를 동기화하는 실행 방식입니다. rollout worker는 이전 정책으로 생성한 샘플을 계속 공급하고 학습 worker는 staleness_threshold 같은 조건에 따라 업데이트된 가중치를 전달받습니다. GPU 유휴 시간을 줄이는 대신 stale sample에 따른 정책 차이를 KL로 관리해야 합니다.
- Rollout 엔진(Rollout Engine)
- — 강화학습 중 현재 정책으로 입력에 대한 응답을 대량 생성하고 각 토큰의 확률 및 보상 계산에 필요한 샘플을 생산하는 실행 구성요소입니다. 기사에서는 vLLM과 SGLang이 rollout을 맡고 AITER kernel을 통해 attention, RMSNorm, RoPE, MoE, quantization 연산을 가속합니다. 생성 속도와 학습 정책과의 수치 일치도가 전체 후학습 효율을 좌우합니다.
기술
- veRL
- ROCm
- PyTorch
- Triton
- vLLM
- SGLang
- AITER
- TransformerEngine
- Megatron-core
- FSDP
- FSDP2
- Docker
- MI300
- MI300X
- MI300A
- MI308
- MI325X
- MI350
- MI350X
- MI355X
- Qwen3-8B
- Qwen2.5-Math-7B
- Qwen3.5-35B-A3B
활용 사례
- LLM 강화학습 후학습
- GRPO 기반 수학·추론 모델 학습
- DAPO 기반 긴 reasoning 응답 학습
- AMD Instinct GPU에서 colocated 후학습
- AMD Instinct GPU에서 fully-async 후학습
- MoE 모델의 Megatron 기반 후학습
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.