본문으로 건너뛰기
HF Daily Papers조회 1

ViPO: 대규모 시각적 선호도 최적화

기존의 시각적 선호도 데이터셋은 품질이 낮고 상충되는 신호가 많아 모델 학습을 방해하는 한계가 있었다. 이 논문은 데이터의 노이즈에 따라 학습 강도를 조절하는 Poly-DPO 알고리즘과 대규모 고품질 데이터셋인 ViPO를 통해 시각 생성 모델의 정렬 성능을 획기적으로 높였다.

용어 해설

직접 선호도 최적화(DPO)
인간의 선호도 데이터를 사용하여 언어 모델이나 생성 모델을 정렬하는 기법이다. 보상 모델을 별도로 학습시키는 대신 선호되는 샘플과 그렇지 않은 샘플의 로그 확률 차이를 직접 최적화하여 모델의 출력을 인간의 가치관에 맞춘다.
테일러 전개(Taylor Expansion)
어떤 함수를 특정 지점에서의 미분계수들을 이용해 무한급수 형태로 표현하는 수학적 방법이다. 이 논문에서는 복잡한 손실 함수를 다항식 형태로 분해하여 분석하고 새로운 가중치 조절 항을 도출하는 데 사용된다.
지도 미세 조정(SFT)
특정 작업에 적합한 고품질 데이터를 사용하여 사전 학습된 모델을 추가로 학습시키는 과정이다. 선호도 최적화 단계 이전에 모델이 기본적인 작업 수행 능력을 갖추도록 하는 필수적인 전처리 단계로 활용된다.

코드 예제

python
dpo_loss = -1 * logsigmoid(logits)
poly_loss = 1 - sigmoid(logits)
loss = dpo_loss + alpha * poly_loss

Poly-DPO를 구현하는 핵심 코드 스니펫으로, 기존 DPO 손실에 다항식 항을 추가하는 방식이다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 29.수집 2026. 05. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.