본문으로 건너뛰기

direct-preference-optimization

직접 선호 최적화

DPO는 비교적 최신의 보상 기반 최적화 기법으로서 모델 출력을 사람의 선호도 신호에 직접 맞추어 파라미터를 조정하는 접근법이다. 아티클에서는 SageMaker의 권한 구성에 DPO를 이용한 서버리스 커스터마이제이션이 포함된다고 명시되어 있어, 맞춤형 미세조정 옵션으로서 역할을 한다. DPO는 RLHF 대안으로 선호도 신호를 활용해 모델 행동을 조정할 때 유용하다.