용어 해설
- 특이값분해(SVD)
- — 행렬을 직교 행렬 두 개와 대각 행렬의 곱으로 분해하여 입력 특징의 주요 성분과 출력 방향을 분리하는 선형대수 기법이다. 본 논문에서는 각 선형층의 U, Σ, V 성분을 '사전학습된 스펙트럼 기저'로 사용하여 가중치 변화의 의미 있는 방향을 정의한다. 이 구조는 파라미터 공간에서 기능적 원자(skill)를 식별하는 역할을 한다.
- 스펙트럴 매니폴드(Spectral Manifold)
- — 사전학습된 가중치의 특이벡터들이 생성하는 부분공간으로서 모델의 핵심 기능들이 압축되어 표상되는 좌표계이다. 논문에서는 이 매니폴드 위로 RL 업데이트를 투영하여 '추론 효과적' 구성요소를 분리했다. 매니폴드는 이후 압축·정화·병합 연산의 기준 좌표계로 사용된다.
- 리와이어링 행렬(Rewiring Matrix)
- — U⊤ ΔW V로 정의되는 r×r 행렬로서 사전학습된 특이벡터 좌표계에서의 가중치 재연결을 수치화한다. 대각성분은 기존 기능의 스케일링을 나타내고, 비대각성분은 서로 다른 잠재 방향들 간의 증거 결합을 나타낸다. 이 행렬을 저장·전달하면 전체 ΔW보다 훨씬 작은 크기로 추론 관련 변경을 표현할 수 있다.
- Pass@k
- — 동일 프롬프트에 대해 k개의 샘플을 생성했을 때 정답을 적어도 하나 포함하는 비율을 의미하는 샘플 기반 평가 지표이다. 본 논문에서는 작은 k에서의 성능과 큰 k에서의 탐색 확률 증분을 비교하여 RL 업데이트의 탐색 특성을 평가했다. Pass@k 곡선의 포화 시점과 기울기가 탐색 유용성의 척도로 사용됐다.
- 저계급 투영(Low-Rank Projection)
- — 원래의 고차원 행렬에서 상위 k개의 특이성분만 추출하여 근사하는 연산으로서 저장 비용을 크게 줄인다. 논문에서는 ΔW의 상위 저계급 근사를 먼저 취한 뒤 이를 사전학습된 특이벡터 공간으로 투영하여 ΔW*를 구성했다. 이 과정은 추론 효과를 보존하면서 파라미터 축소를 가능하게 했다.
- 혼합 도메인 RL(Mix-RL)
- — 수학, 코딩, 지시응답 등 서로 다른 능력을 하나의 RL 업데이트로 동시에 학습하는 방식으로, 서로 다른 도메인 업데이트 간 간섭이 발생할 수 있다. 본 논문에서는 Mix-RL의 잔여 성분이 도메인 간 간섭을 유발한다고 가정하고 SAR로 이를 정화했다. Mix-RL의 정화는 도메인 간 성능 균형을 개선하는 주요 대상이었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



