본문으로 건너뛰기

LLM 포스트 트레이닝 가이드: SFT에서 강화학습까지

LLM의 추론과 대화 능력을 결정짓는 포스트 트레이닝(SFT, RLHF, DPO, PPO)의 핵심 개념과 기술적 구현 방식을 상세히 다룹니다.

섹션별 상세

사전 학습된 모델은 대화의 턴 방식이나 시스템 프롬프트 준수 능력이 부족하여 포스트 트레이닝을 통한 정렬이 필수적이다. 포스트 트레이닝은 모델에게 대화의 시작과 끝을 인식시키고 특정 규칙을 따르도록 유도하는 역할을 수행한다.
SFT(Supervised Fine-Tuning)는 정답 데이터를 모방하여 학습하는 방식으로, 데이터의 품질이 모델 성능의 상한선을 결정한다. 이를 극복하기 위해 여러 체크포인트에서 답변을 생성하고 최적의 답안을 선별하는 Rejection Sampling 기법이 활용된다.
강화학습(RL)은 미분 불가능한 보상 신호를 사용하여 모델의 행동을 최적화하며, SFT의 한계를 넘어 인간의 판단 능력을 실행 능력으로 변환한다. RL은 체스 게임처럼 최종 승리(보상)를 위해 중간 과정의 행동 확률을 조정하는 방식으로 작동한다.
강화학습의 에이전트-환경 상호작용 루프 다이어그램
Diagram에이전트가 환경에 액션을 취하고 데이터를 생성하면 보상 파이프라인을 통해 레이블링된 데이터를 얻어 다시 학습하는 순환 구조를 보여줍니다. 이는 LLM이 자신의 답변에 대한 피드백을 통해 스스로 성능을 개선하는 원리를 설명합니다.
판단 능력과 실행 능력 사이의 간극을 메우는 RL의 역할을 나타낸 그래프
Chart인간의 판단 능력(오류 인식)이 실행 능력보다 높은 영역에서 RL이 어떻게 모델의 성능을 끌어올리는지 시각화합니다. '판단할 수 있다면 배울 수 있다'는 RL의 핵심 철학을 뒷받침합니다.
DPO(Direct Preference Optimization)는 별도의 보상 모델 없이 LLM 자체를 정책 및 보상 모델로 활용하여 선호도를 직접 최적화하는 효율적인 알고리즘이다. PPO와 달리 샘플링 과정이 필요 없어 연산 비용이 저렴하지만, 고정된 데이터셋 내에서만 학습하므로 탐색 능력이 제한된다.
근거
  • DPO는 PPO와 달리 탐색(Exploration)을 수행하지 않으며 고정된 데이터셋에서 학습하는 오프라인 알고리즘이다. Post-training techniques - DPO 섹션의 비교 표
DeepSeek-R1에서 도입된 GRPO(Group Relative Policy Optimization)는 비평가 모델(Critic)을 제거하고 그룹 내 상대적 점수를 사용하여 기준선을 추정함으로써 학습 비용을 획기적으로 절감한다. 이는 대규모 강화학습에서 메모리와 연산 효율성을 동시에 확보할 수 있는 실무적인 접근법이다.
DeepSeek의 GRPO 알고리즘 수식 설명
Diagram비평가 모델 없이 그룹 상대적 보상을 사용하여 정책을 최적화하는 GRPO의 손실 함수를 보여줍니다. 기존 PPO 대비 연산 효율성을 높이는 수학적 근거를 제시합니다.
근거
  • DeepSeek-R1-Zero는 강화학습 과정에서 별도의 지시 없이도 스스로 추론 과정을 재검토하는 '아하 모먼트'를 학습했다. DeepSeek R1 Case Study - Other observations 섹션
  • GRPO는 비평가 모델을 제거함으로써 메모리와 연산 비용을 크게 절감한다. Appendix A - DeepSeek’s GRPO 섹션

기술

  • PyTorch
  • Llama 3
  • DeepSeek-R1
  • PPO
  • DPO
  • GRPO

활용 사례

  • 추론 능력이 강화된 AI 에이전트 개발
  • 특정 도메인 특화 대화형 모델 구축
  • LLM 학습 인프라 최적화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 28.수집 2026. 04. 28.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.