본문으로 건너뛰기

LLM의 반복적이고 기계적인 텍스트 생성을 억제하는 FTPO 기법

LLM의 반복적이고 기계적인 텍스트 패턴인 'Slop'을 추론 단계의 샘플러와 학습 단계의 FTPO 기법으로 90%까지 억제한다.

섹션별 상세

LLM은 학습 데이터의 영향으로 반복적이고 예측 가능한 'Slop' 텍스트를 생성한다. 단순 단어 차단 방식은 문맥을 파괴하고 의미 없는 출력을 유발하여 실무 적용에 한계가 있다.
Anti-slop sampler는 추론 과정에서 반복 패턴을 감지하고 백트래킹을 통해 토큰 확률을 조정한다. 하지만 이 방식은 잦은 백트래킹으로 인해 추론 처리량이 69~96% 감소하는 성능 저하를 동반한다.
Anti-slop sampler의 추론 파이프라인 구조를 보여준다.
Diagram입력 프롬프트에서 출력 생성, 패턴 감지, 백트래킹, 데이터셋 구축으로 이어지는 전체 과정을 시각화한다.
소프트 배닝(Soft Banning) 기법의 작동 예시를 단계별로 설명한다.
Diagram특정 단어(Tapestry)를 금지 목록에 넣고 ban-strength와 min-p를 조절하여 모델이 어떻게 토큰을 재선택하는지 보여준다.
FTPO는 모델이 Slop 토큰을 선택하지 않도록 학습 단계에서 로짓을 직접 조정한다. 세 가지 손실 함수(Preference, Target, Non-target)를 사용하여 특정 토큰만 정밀하게 억제하고 모델의 전체 분포 왜곡을 최소화한다.
Anti-slop sampler와 FTPO 학습 파이프라인을 나타낸다.
Diagram입력부터 샘플러의 백트래킹, 선호도 데이터 수집, FTPO 학습으로 이어지는 전체 흐름을 설명한다.
FTPO는 DPO와 달리 모델의 범용 능력을 효과적으로 보존한다. Gemma 3 12B 모델 테스트에서 DPO는 40% 정확도 이후 품질이 급격히 하락했으나, FTPO는 높은 정확도에서도 품질을 유지하며 90%의 억제 성능을 기록했다.
FTPO와 다른 억제 기법들의 성능 비교 차트이다.
ChartFTPO가 DPO나 토큰 배닝 대비 더 높은 억제율과 더 낮은 품질 저하를 보임을 입증한다.
학습 정확도에 따른 FTPO와 DPO의 품질 변화 그래프이다.
ChartDPO는 정확도가 높아질수록 품질이 급격히 하락하지만, FTPO는 높은 정확도에서도 품질을 유지함을 보여준다.
FTPO와 DPO의 로짓 발산(Logit divergence) 비교 그래프이다.
ChartFTPO는 손실 함수와 early switch-off 기능 덕분에 로짓이 기준값(reference)에 가깝게 유지됨을 보여준다.
근거
  • FTPO는 90%의 Slop을 제거하며 DPO보다 8.5% 더 강력한 억제 효과를 보인다. Fig 6 및 Table 2 비교 데이터

용어 해설

슬롭(Slop)
LLM이 생성하는 반복적이고 예측 가능하며 기계적인 텍스트 패턴을 의미한다. 품질 저하를 유발하며 모델의 출력을 단조롭게 만든다.
백트래킹(Backtracking)
추론 과정에서 원치 않는 패턴이 감지되었을 때, 이전 토큰 생성 시점으로 돌아가 다시 샘플링을 수행하는 기법이다.
로짓(Logit)
모델이 토큰을 생성하기 전 출력하는 원시 점수(raw score)이다. 확률로 변환되기 전의 값으로, 이를 조정하여 특정 토큰의 생성 확률을 제어할 수 있다.
직접 선호 최적화(DPO)
모델의 선호 데이터를 사용하여 보상 모델 없이 직접 정책을 최적화하는 학습 기법이다. 본문에서는 Slop 억제 시 품질 저하를 유발하는 비교 대상으로 언급된다.
Min-p 샘플링(Min-p)
토큰의 확률 분포에서 가장 높은 확률을 가진 토큰 대비 일정 비율 이하의 확률을 가진 토큰들을 제거하는 샘플링 전략이다.

기술

  • Gemma 3
  • FTPO
  • DPO

활용 사례

  • LLM 텍스트 생성 품질 개선
  • 반복적 텍스트 패턴 억제
  • 창의적 글쓰기 모델 최적화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 16.수집 2026. 06. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.