챕터별 상세
01:00
GLP(Generative Latent Prior) 개요
LLM의 내부 활성화 상태를 분석하기 위해 기존의 SAE 대신 확산 모델을 도입한 GLP 기법을 다룬다. 활성화 벡터의 분포를 학습하여 모델 내부의 잠재 공간을 생성적으로 모델링하는 것이 핵심이다. 이를 통해 모델이 특정 개념을 처리할 때의 내부 상태를 더 유연하게 파악할 수 있다.
기존 SAE는 선형성 가정을 전제로 하지만, GLP는 비선형적인 확산 모델을 사용하여 더 복잡한 활성화 패턴을 포착한다.
05:00
GLP 아키텍처 및 확산 프레임워크
활성화 벡터를 연속적인 데이터로 취급하고 Flow Matching 기법을 적용하여 학습을 진행했다. 노이즈 상태에서 실제 활성화 상태로 매핑되는 과정을 통해 모델의 매니폴드 구조를 학습한다. 이 과정에서 MLP 블록을 쌓아 디노이저(Denoiser) 역할을 수행하도록 설계했다.
Flow Matching은 확산 모델 학습 시 데이터 간의 경로를 직접 학습하여 샘플링 속도와 품질을 높이는 최신 기법이다.
10:00
학습 데이터 및 활성화 패턴 분석
Llama 모델의 중간 레이어에서 추출한 10억 개 이상의 토큰 활성화 데이터를 학습에 사용했다. 특정 개념이 활성화 공간 내에서 어떻게 군집화되고 분리되는지 PCA 등을 통해 시각적으로 확인했다. 학습된 메타 모델이 실제 LLM의 활성화 분포를 매우 정확하게 재현함을 입증했다.
20:00
모델 편집 및 제어 결과
GLP를 사용하여 모델의 활성화를 특정 방향으로 유도하는 스티어링(Steering) 실험을 수행했다. 기존 방식보다 문장 생성의 유창성이 더 잘 유지되는 결과가 나타났다. 이는 GLP가 모델이 학습한 데이터 분포 내에서 활성화를 제어하기 때문에 발생하는 이점이다.
On-manifold 제어는 모델이 학습하지 않은 엉뚱한 상태로 빠지는 것을 방지하여 출력 품질을 유지한다.
30:00
루브릭 기반 강화학습(Rubric-Based RL)
모델의 응답 품질을 평가할 때 사람이 정의한 구체적인 기준인 루브릭을 보상 신호로 활용하는 방법론을 검토했다. 단순한 이진 선호도 비교보다 훨씬 세밀한 피드백을 모델에 제공할 수 있다. 이를 통해 모델이 특정 도메인이나 복잡한 지시사항을 더 정확히 따르도록 유도한다.
루브릭은 채점 기준표와 같은 역할을 하며, 모델 평가의 객관성과 세밀함을 높여준다.
40:00
SDPO 및 자가 증류 방법론
모델 스스로 생성한 데이터를 루브릭으로 평가하고 이를 다시 정책 최적화에 사용하는 SDPO 기법을 분석했다. 외부 전문가 데이터에 의존하지 않고도 모델의 추론 성능을 반복적으로 개선할 수 있다. 실험 결과 수학 및 논리 추론 벤치마크에서 유의미한 성능 향상을 보였다.
SDPO는 Self-Distillation Policy Optimization의 약자로, 자가 학습을 통한 성능 고도화 기법이다.
용어 해설
- 생성적 잠재 사전 확률(Generative Latent Prior (GLP))
- — LLM 내부의 활성화 벡터 분포를 확산 모델로 학습하는 기법이다. 모델의 내부 상태를 생성적으로 모델링하여 특정 개념을 제어하거나 해석하는 데 사용된다. 기존의 SAE 방식보다 유연한 구조를 가진다.
- 플로우 매칭(Flow Matching)
- — 확산 모델 학습 시 데이터와 노이즈 사이의 확률 경로를 직접 학습하는 기법이다. 속도 필드를 근사하여 샘플링 효율을 높이고 학습 안정성을 개선한다. GLP 아키텍처의 핵심 학습 알고리즘으로 활용된다.
- 희소 오토인코더(Sparse Autoencoder (SAE))
- — 고차원 활성화 데이터를 소수의 의미 있는 특징으로 분해하는 신경망 구조이다. LLM의 내부 작동 원리를 해석하는 표준적인 도구로 쓰인다. GLP 연구에서 성능 비교를 위한 주요 베이스라인으로 언급된다.
- 자가 증류(Self-Distillation)
- — 모델이 스스로 생성한 데이터를 다시 학습 데이터로 사용하여 성능을 개선하는 기법이다. 외부 전문가의 레이블 없이도 모델의 일관성과 추론 능력을 높일 수 있다. SDPO 알고리즘의 근간이 되는 개념이다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
