용어 해설
- 부분 Rollout(Partial Rollout)
- — 강화학습에서 모든 생성이 끝날 때까지 기다리지 않고, 먼저 완료된 궤적만 학습 배치에 넣는 방식입니다. 아직 생성 중인 요청은 현재 위치에서 멈추고 접두사와 메타데이터를 보존한 뒤, 정책 업데이트와 가중치 동기화가 끝나면 이어서 생성합니다. 긴 응답 때문에 GPU가 대기하는 시간을 줄이는 데 중요합니다.
- On-Policy Distillation
- — 학생 모델이 직접 생성한 궤적을 해당 영역의 전문가 모델이 평가하고, 같은 접두사에서 전문가의 토큰 확률을 학습 신호로 사용하는 증류 방식입니다. 학생이 실제로 방문한 상태에서 토큰 단위의 조밀한 감독을 받으므로 희소한 최종 보상만 사용하는 강화학습을 보완합니다. 여기서는 추론 전문가와 에이전트 전문가를 하나의 모델로 합치는 데 쓰입니다.
- Visual Pre-training
- — PDF 페이지를 이미지로 렌더링한 뒤, 그림·표·수식·배치가 포함된 시각적 표현을 예측하도록 LLM을 추가 학습하는 방법입니다. OCR이나 별도의 수작업 주석 없이 시각 Encoder가 추출한 잠재 벡터의 다음 위치를 맞추며, 텍스트 추출 과정에서 사라지는 문서 구조를 보존합니다. 텍스트 사전학습과 시각 표현 학습을 결합하는 단계입니다.
- 메모리 증강 모델(Memory-Augmented Model)
- — 기존 Backbone의 파라미터를 다시 학습하지 않고, 별도로 훈련한 외부 메모리 모듈을 연결해 특정 도메인의 지식과 작업 패턴을 보강하는 구조입니다. Backbone과 Memory Decoder가 같은 문맥에서 각각 다음 토큰 분포를 계산하고, Token-level Router가 두 분포의 결합 비율을 동적으로 정합니다. 범용 능력을 유지하면서 생명과학 같은 새 분야를 모듈 방식으로 확장하는 데 쓰입니다.
- Speculative Decoding
- — 작은 Draft Model이 여러 후보 토큰을 먼저 생성하고, 현재 정책 모델이 이를 병렬 검증하는 추론 가속 방식입니다. 정확한 Rejection Sampling을 사용하면 현재 정책의 샘플링 분포를 바꾸지 않으면서 생성 시간을 줄일 수 있습니다. 이 논문은 정책 변화에 맞춰 Draft Model을 온라인 학습하고 Forward KL과 Total Variation을 함께 최적화합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





