본문으로 건너뛰기

온폴리시 자기 증류를 통한 AI 모델의 지속적 학습 및 성능 개선

온폴리시 자기 증류(OPSD)를 사용하여 AI 모델이 스스로 힌트를 생성하고 학습함으로써, 기존 RLHF나 GRPO의 한계를 극복하고 지속적으로 성능을 개선하는 방법.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기존의 AI 학습 알고리즘은 온라인 작업 분포, 온폴리시 샘플링, 병렬 롤아웃, 토큰 단위 보상이라는 4가지 핵심 조건을 동시에 충족하지 못해 성능 향상에 한계가 있다. Trajectory는 온폴리시 자기 증류(On-Policy Self-Distillation, OPSD)를 통해 이 문제를 해결한다. 모델에 힌트를 제공하여 스스로를 가르치게 함으로써 전체 어휘를 최적화하고, 힌트 누출과 같은 보상 해킹 문제를 스텝별 발산 가중치와 잔차 지도로 해결한다. 이는 모델이 실세계 데이터를 통해 지속적으로 성능을 개선하는 기반이 된다.

챕터별 상세

01:05

지속적 학습의 필요성과 한계

AI 벤치마크는 빠르게 포화 상태에 도달하며, 이를 확장하는 데 드는 비용과 시간이 급격히 증가하고 있다. 모델이 실세계에서 생성하는 수조 개의 토큰 데이터는 학습에 활용되지 않고 버려지고 있다. 이는 모델이 실시간으로 데이터를 학습하지 못하고 정적인 상태에 머물러 있음을 의미한다. 지속적 학습은 모델이 실세계의 피드백을 통해 스스로 개선되도록 만드는 핵심 과제이다.

벤치마크 포화는 모델이 기존 평가 지표에서 이미 최고 점수에 도달하여 더 이상 성능 향상을 측정하기 어려워진 상황을 의미한다.

02:51

학습 알고리즘의 4가지 조건

효과적인 학습 알고리즘은 온라인 작업 분포, 온폴리시 샘플링, 병렬 롤아웃, 토큰 단위 보상이라는 4가지 조건을 충족해야 한다. SFT는 온폴리시 샘플링이 없고, RLHF는 오프폴리시 샘플링을 사용하며, GRPO는 온폴리시 샘플링을 지원하지만 병렬 롤아웃 비용이 크고 보상이 시퀀스 단위로 압축된다. 이러한 제약은 모델이 복잡한 추론을 수행할 때 성능 저하를 유발한다.

온폴리시 샘플링은 현재 모델이 생성한 데이터를 기반으로 학습하는 방식을 의미한다.

08:43

온폴리시 자기 증류(OPSD)의 원리

OPSD는 모델 스스로를 교사로 활용하여 학습하는 기법이다. 모델에 힌트라는 특권 정보를 제공하고, 힌트가 없는 학생 모델의 로그 확률을 힌트가 있는 교사 모델의 로그 확률에 맞추도록 학습한다. 이 과정에서 전체 어휘에 대해 토큰 단위로 최적화를 수행한다. 이는 GRPO가 시퀀스 단위의 점수만으로 학습하던 한계를 극복하고 더 정밀한 피드백을 제공한다.

로그 확률(log probs)은 모델이 특정 토큰을 선택할 확률의 로그값으로, 학습의 목표치가 된다.

12:52

OPSD의 도전 과제와 해결책

긴 작업에서 모델이 힌트에 의존하여 추론을 생략하는 힌트 누출과, 모델이 힌트와 동떨어진 분포로 발산하는 문제가 발생한다. 이를 해결하기 위해 스텝별 KL 발산을 측정하여 가중치를 조절하는 스텝별 발산 가중치 기법을 적용한다. 또한 잔차 지도를 통해 힌트의 강도를 조절함으로써 모델이 힌트에 과도하게 의존하지 않고 스스로 추론할 수 있도록 유도한다.

KL 발산은 두 확률 분포가 얼마나 다른지를 측정하는 지표이다.

19:45

지속적 학습의 미래

OPSD는 기존 학습 알고리즘의 한계를 극복하고 4가지 조건을 모두 충족하는 학습 환경을 제공한다. 이를 통해 모델은 실세계의 데이터를 지속적으로 학습하며 성능을 개선하는 선순환 구조를 갖게 된다. Trajectory는 이러한 학습 루프를 자동화하는 플랫폼을 구축하고 있다. 소프트웨어가 사용될수록 스스로 더 똑똑해지는 시스템이 지속적 학습의 최종 목표이다.

용어 해설

온폴리시 자기 증류(On-Policy Self-Distillation)
모델이 스스로 생성한 궤적에 힌트를 결합하여 학습하는 기법이다. 외부의 더 큰 모델 없이 모델 스스로를 교사로 활용하며, 전체 어휘에 대해 토큰 단위로 최적화를 수행하여 학습 효율을 높인다.
그룹 상대 정책 최적화(GRPO)
여러 개의 롤아웃을 생성하고 그들 간의 상대적 보상을 통해 모델을 학습시키는 기법이다. 온폴리시 샘플링을 지원하지만, 시퀀스 전체에 하나의 보상만 부여되어 세부적인 피드백이 어렵다는 한계가 있다.
힌트 누출(Hint Leakage)
모델 학습 시 제공된 힌트에 정답 정보가 포함되어 있어, 모델이 추론 과정을 생략하고 정답만 출력하는 현상이다. 강화학습의 보상 해킹과 유사한 문제로, 모델의 논리적 사고력을 저해한다.
잔차 지도(Residual Guidance)
힌트의 강도를 조절하여 모델이 힌트에 과도하게 의존하지 않도록 하는 기법이다. 전체 힌트와 부분 힌트의 선형 결합을 통해 모델이 힌트 없이도 스스로 추론할 수 있는 능력을 유지하게 한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 12.수집 2026. 08. 13.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.