용어 해설
- 층 기여도(Layer Contribution)
- — 한 층을 단독으로 RL로 학습했을 때 얻는 성능 향도를 전체(풀 파라미터) RL로 얻는 향도에 대한 비율로 정의한 지표로, 특정 층이 RL에 기여하는 상대적 효과를 정량화한다.
- 단일 층 학습(Single-Layer Training)
- — 사전학습된 모델에서 특정 Transformer 층 하나만 파라미터를 업데이트하고 나머지 층은 동결한 채로 RL 최적화를 수행하는 절차로, 층별로 RL 적응 능력을 분리하여 측정할 수 있게 한다.
- Group Relative Policy Optimization(GRPO)
- — 그룹 단위 샘플링으로 advantage를 정규화하여 사용하는 RL 최적화 알고리즘으로, value 네트워크 없이 importance ratio와 KL 페널티를 포함한 클리핑된 목적함수를 통해 정책을 갱신한다.
- 중간층 휴리스틱(Middle-Layer Heuristic)
- — 층 기여도 프로파일을 직접 계산하지 않고 모델 깊이의 중앙에 위치한 k개 층만 선택해 RL로 재학습하는 간단한 전략으로, 프로파일링 비용 없이도 실험적으로 의미 있는 향상을 얻는 방법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


