용어 해설
- RLVR
- — RLVR은 Reinforcement Learning with Verifiable Rewards의 약자로, 수학적으로 검증 가능한 보상을 사용하여 LLM의 추론 능력을 강화하는 강화학습 파이프라인이다.
- 랭크-1(Rank-1)
- — 딥러닝 파라미터 업데이트에서 각 텐서가 차지하는 주된 변화 방향을 의미하는 단일 방향성(rank-1)이다. 이 방향으로의 투영이 주요 업데이트를 설명한다.
- SVD
- — Singular Value Decomposition의 약자로, 행렬을 직교 기저의 곱으로 분해하여 주성분과 분해 계수의 구조를 파악하는 기법이다.
- 저랭크 궤적(low-rank trajectories)
- — RLVR 학습 중 파라미터 업데이트가 저랭크 서브스페이스에 주로 몰려 있다는 관찰로, 이를 활용해 예측 및 외삽을 가능하게 한다.
- 노이즈 제거(denoising)
- — Rank-1 투영을 통해 불확실한 노이즈를 제거하고 안정적인 신호만 남기는 효과를 말한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


