용어 해설
- 직접 선호도 최적화(DPO)
- — 인간의 선호도 데이터를 사용하여 언어 모델이나 생성 모델을 정렬하는 기법이다. 보상 모델을 별도로 학습시키는 대신 선호되는 샘플과 그렇지 않은 샘플의 로그 확률 차이를 직접 최적화하여 모델의 출력을 인간의 가치관에 맞춘다.
- 테일러 전개(Taylor Expansion)
- — 어떤 함수를 특정 지점에서의 미분계수들을 이용해 무한급수 형태로 표현하는 수학적 방법이다. 이 논문에서는 복잡한 손실 함수를 다항식 형태로 분해하여 분석하고 새로운 가중치 조절 항을 도출하는 데 사용된다.
- 지도 미세 조정(SFT)
- — 특정 작업에 적합한 고품질 데이터를 사용하여 사전 학습된 모델을 추가로 학습시키는 과정이다. 선호도 최적화 단계 이전에 모델이 기본적인 작업 수행 능력을 갖추도록 하는 필수적인 전처리 단계로 활용된다.
코드 예제
dpo_loss = -1 * logsigmoid(logits)
poly_loss = 1 - sigmoid(logits)
loss = dpo_loss + alpha * poly_lossPoly-DPO를 구현하는 핵심 코드 스니펫으로, 기존 DPO 손실에 다항식 항을 추가하는 방식이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.