챕터별 상세
SDPO의 핵심 개념과 동기
기존의 RLVR(Reinforcement Learning with Verifiable Rewards) 방식은 성공 여부에 따른 0 또는 1의 스칼라 보상만 제공하므로 정보 밀도가 낮다. SDPO는 코딩 문제의 런타임 에러나 테스트 케이스 결과와 같은 풍부한 텍스트 피드백을 활용하여 학습 신호를 강화한다. 이를 통해 모델은 단순히 정답 여부뿐만 아니라 '왜' 틀렸는지에 대한 정보를 학습 과정에 반영할 수 있다.
자기 교사(Self-teacher) 작동 원리
SDPO는 동일한 모델을 '학생'과 '교사'라는 두 가지 역할로 활용한다. 학생 모델이 답변을 생성하면, 환경으로부터 받은 피드백을 프롬프트에 추가하여 동일 모델을 교사 모델로 변환한다. 교사 모델은 학생이 생성한 각 토큰 시퀀스를 입력받아 각 위치에서 더 나은 토큰 확률 분포를 계산하며, 학생은 이 분포와의 차이(KL 발산)를 줄이는 방향으로 업데이트된다.
text
Algorithm 1 SDPO
1: Sample question x from dataset
2: Sample responses y_1...y_G from student pi_theta
3: Obtain environment feedback f_1...f_G
4: Compute log probs of self-teacher:
pi_theta(y_t | x, f, y_{<t})
5: Compute log probs of student:
pi_theta(y_t | x, y_{<t})
6: Update theta with gradient descent on L_SDPOSDPO 알고리즘의 핵심 루프를 설명하는 의사코드
GRPO와의 성능 및 효율성 비교
SDPO는 GRPO 대비 훨씬 적은 샘플 수로도 더 높은 벤치마크 정확도를 달성했다. 특히 SDPO로 학습된 모델은 GRPO 모델보다 평균적으로 더 짧고 직접적인 추론 경로를 생성하는 경향을 보였다. 이는 불필요한 사고 과정을 줄이고 핵심적인 추론 단계에 집중하도록 모델이 정렬되었음을 의미한다.
안정적인 학습을 위한 구현 기법
학습의 안정성을 높이기 위해 지수 이동 평균(EMA)을 적용한 교사 모델 가중치를 사용하거나 초기 모델과 현재 모델을 보간하는 방식을 사용한다. 또한 전체 어휘 사전에 대한 확률 분포를 계산하는 비용을 줄이기 위해 상위 100개의 토큰만 고려하는 근사 기법을 적용했다. 이러한 최적화를 통해 GRPO 대비 약 5~17% 정도의 추가 연산 비용만으로 비약적인 성능 향상을 이끌어냈다.
용어 해설
- 자기 증류 정책 최적화(SDPO)
- — 모델이 생성한 답변에 에러 메시지 등 피드백을 추가하여 스스로 '교사' 역할을 수행하게 함으로써 성능을 개선하는 강화학습 기법이다. 별도의 보상 모델 없이 모델 내부의 지식을 활용해 추론 능력을 정렬하며, 학습 효율이 높다는 장점이 있다.
- 그룹 상대 정책 최적화(GRPO)
- — DeepSeek 등에서 사용된 기법으로, 여러 샘플의 평균 보상을 기준으로 개별 샘플의 우위를 판단하여 모델을 학습시킨다. 보상 모델의 복잡성을 줄였으나, SDPO에 비해 토큰 단위의 정밀한 피드백을 제공하기 어렵다는 한계가 있다.
- 교사 강제(Teacher Forcing)
- — 모델 학습 시 이전 단계에서 모델이 예측한 값 대신 실제 정답(Ground Truth)을 다음 단계의 입력으로 사용하는 기법이다. SDPO에서는 교사 모델이 학생 모델이 생성한 토큰 시퀀스를 그대로 입력받아 각 위치에서의 확률 분포를 계산하는 데 사용된다.
- 쿨백-라이블러 발산(KL Divergence)
- — 두 확률 분포 간의 차이를 측정하는 통계적 지표이다. 강화학습 기반 LLM 학습에서 현재 모델의 정책이 참조 모델(또는 교사 모델)로부터 너무 멀어지지 않도록 제약하는 손실 함수로 주로 활용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 14.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

