본문으로 건너뛰기
HF Daily Papers조회 1

한 층만 훈련해도 충분한가: 단일 Transformer 층 학습으로 전체 파라미터 RL 훈련과 동등하거나 더 나은 성능 달성

여러 모델·알고리즘·과제에서 RL 향상이 트랜스포머의 중간층에 집중되어 단일 층 학습만으로 전체 파라미터 RL의 이득을 거의 복구하거나 초과할 수 있음을 실험적으로 보였다.

용어 해설

층 기여도(Layer Contribution)
한 층을 단독으로 RL로 학습했을 때 얻는 성능 향도를 전체(풀 파라미터) RL로 얻는 향도에 대한 비율로 정의한 지표로, 특정 층이 RL에 기여하는 상대적 효과를 정량화한다.
단일 층 학습(Single-Layer Training)
사전학습된 모델에서 특정 Transformer 층 하나만 파라미터를 업데이트하고 나머지 층은 동결한 채로 RL 최적화를 수행하는 절차로, 층별로 RL 적응 능력을 분리하여 측정할 수 있게 한다.
Group Relative Policy Optimization(GRPO)
그룹 단위 샘플링으로 advantage를 정규화하여 사용하는 RL 최적화 알고리즘으로, value 네트워크 없이 importance ratio와 KL 페널티를 포함한 클리핑된 목적함수를 통해 정책을 갱신한다.
중간층 휴리스틱(Middle-Layer Heuristic)
층 기여도 프로파일을 직접 계산하지 않고 모델 깊이의 중앙에 위치한 k개 층만 선택해 RL로 재학습하는 간단한 전략으로, 프로파일링 비용 없이도 실험적으로 의미 있는 향상을 얻는 방법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.