본문으로 건너뛰기

최소한의 RLVR 훈련으로 LLM의 외삽을 달성하는 방법: Rank-1 궤적 기반

RLVR은 대규모 언어모델의 추론 능력을 개선하는 핵심 기법이지만 계산 비용이 큼. 이 논문은 RLVR 업데이트가 매우 저랭크이며 대부분의 개선이 rank-1 구성요소에 의해 설명될 수 있음을 보인다. 이로써 초기 관찰 구간을 바탕으로 앞으로의 체크포인트를 예측하는 간단하고 계산 효율적인 RELEX를 제안하고, 최소 15–20%의 RLVR 학습 비용으로도 전체 성능에 근접하거나 개선된 결과를 얻을 수 있음을 보인다. 또한 rank-1 서브스페이스를 통한 투영이 노이즈를 제거하는 “스펙트럴 denoising” 효과를 갖는다는 점을 제시한다.

용어 해설

RLVR
RLVR은 Reinforcement Learning with Verifiable Rewards의 약자로, 수학적으로 검증 가능한 보상을 사용하여 LLM의 추론 능력을 강화하는 강화학습 파이프라인이다.
랭크-1(Rank-1)
딥러닝 파라미터 업데이트에서 각 텐서가 차지하는 주된 변화 방향을 의미하는 단일 방향성(rank-1)이다. 이 방향으로의 투영이 주요 업데이트를 설명한다.
SVD
Singular Value Decomposition의 약자로, 행렬을 직교 기저의 곱으로 분해하여 주성분과 분해 계수의 구조를 파악하는 기법이다.
저랭크 궤적(low-rank trajectories)
RLVR 학습 중 파라미터 업데이트가 저랭크 서브스페이스에 주로 몰려 있다는 관찰로, 이를 활용해 예측 및 외삽을 가능하게 한다.
노이즈 제거(denoising)
Rank-1 투영을 통해 불확실한 노이즈를 제거하고 안정적인 신호만 남기는 효과를 말한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 20.수집 2026. 05. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.