섹션별 상세
기존의 지속 학습 모델은 새로운 도메인 학습 시 이전 지식을 잃어버리는 파괴적 망각 문제가 고질적이었다. Brainstacks는 각 도메인을 독립적인 MoE-LoRA 스택으로 패키징하고 베이스 모델을 동결하여 지식 간 간섭을 원천 차단한다.
MoE-LoRA 구조는 Shazeer 방식의 노이즈 포함 top-2 라우팅을 7개의 트랜스포머 프로젝션 전체에 적용한다. QLoRA 4비트 양자화와 rsLoRA 스케일링을 결합하여 메모리 효율성과 학습 안정성을 동시에 확보한다.
새로운 스택을 학습할 때 randomized SVD를 활용한 영공간 투영(Null-space projection)을 수행한다. 이 기법은 새로운 가중치 업데이트가 이전 스택의 하위 공간과 직교하도록 강제하여 개별 스택의 독립성을 보장한다.
추론 시에는 결과 기반의 시그모이드 메타 라우터가 여러 스택의 가중치를 동적으로 조절한다. 이를 통해 특정 도메인에 국한되지 않고 여러 스택의 능력을 조합하여 복합적인 문제를 해결하는 교차 도메인 구성을 가능하게 한다.
실험 결과 의학 데이터가 전혀 없는 상태에서도 의학 관련 프롬프트가 채팅과 수학 스택으로 라우팅되는 현상이 97% 확률로 관찰됐다. 이는 모델이 단순 지식이 아닌 지시 이행, 수치 추론, 절차적 논리 같은 범용적 인지 프리미티브를 학습했음을 시사한다.
근거
- 의학 데이터가 없는 스택임에도 불구하고 의학 프롬프트의 97%가 채팅 및 수학 스택으로 라우팅되었다. — Abstract - The central finding
용어 해설
- 전문가 혼합 LoRA(MoE-LoRA)
- — Mixture of Experts(MoE)와 LoRA를 결합한 구조이다. 트랜스포머 층에 여러 어댑터를 배치하고 라우터가 입력에 따라 최적의 어댑터를 선택하게 함으로써 모델 용량을 효율적으로 확장한다.
- 영공간 투영(Null-Space Projection)
- — 새로운 학습 가중치가 기존 지식의 하위 공간과 직교하도록 수학적으로 강제하는 기법이다. 이를 통해 새로운 정보를 학습하면서도 기존 파라미터 정보를 훼손하지 않아 파괴적 망각을 방지한다.
- 지속적 학습(Continual Learning)
- — 모델이 새로운 데이터를 순차적으로 학습하면서도 이전에 습득한 지식을 잃어버리지 않게 하는 기법이다. 데이터가 계속 추가되는 실제 서비스 환경에서 모델을 재학습시키지 않고 업데이트하는 데 필수적이다.
- 양자화된 저순위 적응(QLoRA)
- — 4비트 양자화를 통해 모델 가중치를 압축한 상태에서 LoRA를 적용하는 효율적 파인튜닝 기법이다. 메모리 사용량을 획기적으로 줄여 일반 소비자용 GPU에서도 대규모 모델 학습을 가능하게 한다.
- 랭크 안정화 LoRA(rsLoRA)
- — LoRA의 랭크(rank) 크기에 따라 스케일링 팩터를 조정하여 학습 안정성을 높이는 기법이다. 랭크가 커질 때 발생할 수 있는 그래디언트 폭주 문제를 해결하여 더 깊은 어댑터 학습을 지원한다.
근거 모음
근거
- MoE-LoRA는 파라미터 수가 동일한 단일 LoRA보다 2.5배 빠른 수렴 속도를 달성했다. — Abstract - Validated on TinyLlama-1.1B and Gemma 3 12B IT
기술
- TinyLlama-1.1B
- Gemma 3 12B IT
- MoE-LoRA
- QLoRA
- rsLoRA
- DPO
- GRPO
활용 사례
- 지속적 학습(Continual Learning)
- 다중 도메인 챗봇
- 비용 효율적 모델 확장
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 02.수집 2026. 04. 04.출처 타입 PAPER
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.