섹션별 상세
사전 학습된 모델은 대화의 턴 방식이나 시스템 프롬프트 준수 능력이 부족하여 포스트 트레이닝을 통한 정렬이 필수적이다. 포스트 트레이닝은 모델에게 대화의 시작과 끝을 인식시키고 특정 규칙을 따르도록 유도하는 역할을 수행한다.
SFT(Supervised Fine-Tuning)는 정답 데이터를 모방하여 학습하는 방식으로, 데이터의 품질이 모델 성능의 상한선을 결정한다. 이를 극복하기 위해 여러 체크포인트에서 답변을 생성하고 최적의 답안을 선별하는 Rejection Sampling 기법이 활용된다.
강화학습(RL)은 미분 불가능한 보상 신호를 사용하여 모델의 행동을 최적화하며, SFT의 한계를 넘어 인간의 판단 능력을 실행 능력으로 변환한다. RL은 체스 게임처럼 최종 승리(보상)를 위해 중간 과정의 행동 확률을 조정하는 방식으로 작동한다.


DPO(Direct Preference Optimization)는 별도의 보상 모델 없이 LLM 자체를 정책 및 보상 모델로 활용하여 선호도를 직접 최적화하는 효율적인 알고리즘이다. PPO와 달리 샘플링 과정이 필요 없어 연산 비용이 저렴하지만, 고정된 데이터셋 내에서만 학습하므로 탐색 능력이 제한된다.
근거
- DPO는 PPO와 달리 탐색(Exploration)을 수행하지 않으며 고정된 데이터셋에서 학습하는 오프라인 알고리즘이다. — Post-training techniques - DPO 섹션의 비교 표
DeepSeek-R1에서 도입된 GRPO(Group Relative Policy Optimization)는 비평가 모델(Critic)을 제거하고 그룹 내 상대적 점수를 사용하여 기준선을 추정함으로써 학습 비용을 획기적으로 절감한다. 이는 대규모 강화학습에서 메모리와 연산 효율성을 동시에 확보할 수 있는 실무적인 접근법이다.

근거
- DeepSeek-R1-Zero는 강화학습 과정에서 별도의 지시 없이도 스스로 추론 과정을 재검토하는 '아하 모먼트'를 학습했다. — DeepSeek R1 Case Study - Other observations 섹션
- GRPO는 비평가 모델을 제거함으로써 메모리와 연산 비용을 크게 절감한다. — Appendix A - DeepSeek’s GRPO 섹션
기술
- PyTorch
- Llama 3
- DeepSeek-R1
- PPO
- DPO
- GRPO
활용 사례
- 추론 능력이 강화된 AI 에이전트 개발
- 특정 도메인 특화 대화형 모델 구축
- LLM 학습 인프라 최적화
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 28.수집 2026. 04. 28.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.