섹션별 상세
LLM은 학습 데이터의 영향으로 반복적이고 예측 가능한 'Slop' 텍스트를 생성한다. 단순 단어 차단 방식은 문맥을 파괴하고 의미 없는 출력을 유발하여 실무 적용에 한계가 있다.
Anti-slop sampler는 추론 과정에서 반복 패턴을 감지하고 백트래킹을 통해 토큰 확률을 조정한다. 하지만 이 방식은 잦은 백트래킹으로 인해 추론 처리량이 69~96% 감소하는 성능 저하를 동반한다.


FTPO는 모델이 Slop 토큰을 선택하지 않도록 학습 단계에서 로짓을 직접 조정한다. 세 가지 손실 함수(Preference, Target, Non-target)를 사용하여 특정 토큰만 정밀하게 억제하고 모델의 전체 분포 왜곡을 최소화한다.

FTPO는 DPO와 달리 모델의 범용 능력을 효과적으로 보존한다. Gemma 3 12B 모델 테스트에서 DPO는 40% 정확도 이후 품질이 급격히 하락했으나, FTPO는 높은 정확도에서도 품질을 유지하며 90%의 억제 성능을 기록했다.



근거
- FTPO는 90%의 Slop을 제거하며 DPO보다 8.5% 더 강력한 억제 효과를 보인다. — Fig 6 및 Table 2 비교 데이터
용어 해설
- 슬롭(Slop)
- — LLM이 생성하는 반복적이고 예측 가능하며 기계적인 텍스트 패턴을 의미한다. 품질 저하를 유발하며 모델의 출력을 단조롭게 만든다.
- 백트래킹(Backtracking)
- — 추론 과정에서 원치 않는 패턴이 감지되었을 때, 이전 토큰 생성 시점으로 돌아가 다시 샘플링을 수행하는 기법이다.
- 로짓(Logit)
- — 모델이 토큰을 생성하기 전 출력하는 원시 점수(raw score)이다. 확률로 변환되기 전의 값으로, 이를 조정하여 특정 토큰의 생성 확률을 제어할 수 있다.
- 직접 선호 최적화(DPO)
- — 모델의 선호 데이터를 사용하여 보상 모델 없이 직접 정책을 최적화하는 학습 기법이다. 본문에서는 Slop 억제 시 품질 저하를 유발하는 비교 대상으로 언급된다.
- Min-p 샘플링(Min-p)
- — 토큰의 확률 분포에서 가장 높은 확률을 가진 토큰 대비 일정 비율 이하의 확률을 가진 토큰들을 제거하는 샘플링 전략이다.
기술
- Gemma 3
- FTPO
- DPO
활용 사례
- LLM 텍스트 생성 품질 개선
- 반복적 텍스트 패턴 억제
- 창의적 글쓰기 모델 최적화
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 16.수집 2026. 06. 16.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.