본문으로 건너뛰기

레이블 없이 테스트 타임에 학습하는 TTPO: 비대칭 목적 함수를 통한 LLM 성능 최적화

TTPO는 다수결 의사결정 기반의 비대칭 목적 함수를 사용하여, 외부 레이블 없이도 테스트 타임에 모델을 효과적으로 학습시키는 프레임워크이다.

용어 해설

On-Policy Self-Distillation(OPSD)
모델이 생성한 샘플 중 정답과 일치하는 것을 증류하여 학습하는 기법이다. 모델의 정책을 스스로 생성한 고품질 데이터로 정렬하여 성능을 높인다.
Test-Time Training(TTT)
추론 단계에서 모델의 가중치를 추가로 조정하여 특정 작업 성능을 높이는 기법이다. 외부 레이블 없이 모델의 자체적인 적응력을 활용한다.
Grouped RL
여러 샘플 그룹을 비교하여 강화학습을 수행하는 방식이다. 샘플 간의 불일치를 보상 신호로 활용하여 모델의 오류를 교정한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 08. 29.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.