본문으로 건너뛰기

ReMix: LLM 파인튜닝을 위한 Mixture-of-LoRAs의 강화학습 기반 라우팅

기존의 여러 LoRA를 섞어 쓰는 방식은 학습 과정에서 특정 LoRA 하나에만 의존하게 되는 라우팅 가중치 붕괴 현상 때문에 효율이 떨어졌다. ReMix는 강화학습을 도입해 모든 활성화된 LoRA가 골고루 기여하게 만듦으로써, 더 적은 파라미터로도 수학 연산과 코드 생성 등 복잡한 작업에서 뛰어난 성능을 보여준다.

용어 해설

저순위 어댑터(LoRA)
사전 학습된 모델의 가중치를 고정한 채, 작은 크기의 두 행렬만을 추가하여 학습시키는 기법이다. 전체 파라미터를 업데이트하지 않아도 되므로 메모리와 연산 비용을 획기적으로 줄이면서 모델을 특정 작업에 맞게 조정할 수 있다.
전문가 혼합(Mixture-of-Experts)
입력 데이터에 따라 여러 개의 작은 신경망(전문가) 중 일부만을 선택적으로 활성화하여 처리하는 구조이다. 전체 모델 크기는 키우면서도 실제 연산량은 낮게 유지할 수 있어 대규모 언어 모델의 효율성을 높이는 데 사용된다.
라우팅 가중치 붕괴(Routing Weight Collapse)
여러 전문가 모델을 섞어 쓸 때, 학습 과정에서 특정 전문가 하나에만 가중치가 쏠려 나머지 전문가들이 전혀 활용되지 못하는 현상이다. 이로 인해 다중 모델을 사용하는 이점이 사라지고 단일 모델과 다를 바 없는 성능을 내게 된다.
강화학습 기반 리브-원-아웃 추정기(RLOO)
강화학습에서 여러 번의 시도(샘플)를 한 뒤, 특정 시도의 성과를 나머지 시도들의 평균과 비교하여 보상을 계산하는 방식이다. 그래디언트의 분산을 줄여 학습을 더 안정적으로 만들어주는 효과가 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 11.수집 2026. 03. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.