챕터별 상세
00:00
지속적 학습의 한계와 모델 병합의 등장 배경
지속적 학습에서 발생하는 치명적 망각(Catastrophic Forgetting) 문제를 해결하기 위한 기존 방식들의 한계를 짚는다. 아키텍처 기반, 리플레이 기반, 규제 기반 방식들은 모두 학습 단계에서 추가적인 비용이나 데이터 저장이 필요하다는 단점이 있다. 이에 대한 대안으로 학습이 끝난 후 모델의 가중치를 수학적으로 결합하는 모델 병합(Model Merging) 방식이 새로운 해결책으로 제시되었다.
06:10
Task Vector의 정의와 산술 연산의 원리
태스크 벡터(Task Vector)는 특정 작업에 대해 Fine-tuning된 모델 가중치에서 사전 학습된 모델 가중치를 뺀 값으로 정의된다. 이 벡터는 모델이 특정 능력을 얻기 위해 파라미터 공간에서 이동한 방향과 거리를 의미하며, 그 자체가 독립적인 지식의 단위가 된다. 이를 활용하면 뺄셈(Negation), 덧셈(Addition), 유추(Analogy)와 같은 산술 연산이 가능해진다.
python
task_vector = fine_tuned_weights - pre_trained_weights
negated_model = pre_trained_weights - lambda * task_vector
merged_model = pre_trained_weights + (task_vector_1 + task_vector_2)Task Arithmetic의 핵심인 태스크 벡터 계산 및 뺄셈(Negation), 덧셈(Addition) 연산의 개념적 구현
10:10
Negation: 모델에서 특정 지식 및 유해성 제거
모델에서 태스크 벡터를 빼는 연산(Negation)을 통해 특정 능력을 의도적으로 제거할 수 있다. 예를 들어, 유해한 텍스트 생성 능력을 가진 모델에서 해당 태스크 벡터를 빼면 다른 일반적인 성능은 유지하면서 독성 문장 생성 확률만 획기적으로 낮출 수 있다. 실험 결과, Gradient Ascent와 같은 기존 방식보다 다른 작업의 성능을 더 잘 보존하면서 타겟 능력만 효과적으로 제거했다.
14:10
Addition: 여러 모델의 능력을 하나로 통합
여러 작업에 대해 각각 학습된 태스크 벡터들을 사전 학습된 모델에 더함으로써 멀티태스크 모델을 구현했다. 이미지 분류 작업에서 8개의 서로 다른 데이터셋에 대한 태스크 벡터를 합산했을 때, 각 작업을 개별적으로 Fine-tuning한 모델에 근접하는 성능을 보였다. 이는 태스크 벡터들이 유기적으로 결합되어 지식이 축적될 수 있음을 증명한다.
16:40
Analogies: 데이터 부족 상황에서의 지식 유추
A:B = C:D의 관계를 이용해 데이터가 부족한 작업의 성능을 높이는 유추(Analogy) 연산을 소개했다. 예를 들어 '실내 강아지'와 '실외 강아지'의 차이 벡터를 '실외 사자' 모델에 적용하여 데이터가 거의 없는 '실내 사자' 인식 모델을 생성할 수 있다. 실험 결과, 약 100개의 타겟 데이터를 직접 학습시킨 것과 유사한 수준의 정확도 향상을 보였다.
19:40
MagMax: 지속적 학습을 위한 가중치 선택 기법
순차적 학습 환경에서 모델 병합의 효율을 극대화하기 위한 MagMax 방법론을 제안했다. 핵심은 가중치 업데이트 시 절대값이 가장 큰 파라미터가 해당 작업의 핵심 지식을 담고 있다는 가설에 기반하여, 파라미터 위치별로 가장 변화량이 큰 가중치를 선택하는 Maximum Magnitude Selection을 도입한 것이다. 이를 통해 가중치 간의 부호 충돌(Sign Conflict)을 억제하고 지식 소실을 방지했다.
26:10
실험 결과 분석 및 모델 병합의 유효성 검증
CIFAR-100, ImageNet-R 등 다양한 벤치마크에서 MagMax의 성능을 측정했다. 태스크 수가 많아질수록 기존 병합 방식인 Ties-merging보다 성능 격차를 벌리며 압도적인 우위를 보였다. 특히 이전에 학습한 작업에 대한 지식 보존 능력뿐만 아니라, 아직 학습하지 않은 미래 작업에 대한 Zero-shot 성능(Forward Transfer)도 가장 높게 나타났다.
용어 해설
- 지속적 학습(Continual Learning)
- — 시간이 지남에 따라 새로운 데이터나 작업을 순차적으로 학습하는 기법이다. 새로운 지식을 습득하면서도 과거에 배운 지식을 잊어버리지 않게 유지하는 것이 핵심 과제이다.
- 치명적 망각(Catastrophic Forgetting)
- — 신경망이 새로운 작업을 학습할 때 이전에 학습했던 작업의 정보를 급격히 잃어버리는 현상이다. 가중치가 새로운 작업에 최적화되면서 과거의 최적점에서 멀어지기 때문에 발생한다.
- 태스크 벡터(Task Vector)
- — 특정 작업에 대해 Fine-tuning된 모델의 가중치에서 사전 학습된(Pre-trained) 모델의 가중치를 뺀 차이값이다. 해당 작업에 필요한 지식의 변화량을 벡터 공간에서 정의한 것이다.
- 모델 병합(Model Merging)
- — 서로 다른 작업에 특화된 여러 모델의 가중치를 별도의 추가 학습 없이 수학적으로 결합하여 하나의 모델로 만드는 기법이다. 연산 효율성이 높고 데이터 재학습이 필요 없다는 장점이 있다.
- 언러닝(Unlearning)
- — 모델이 이미 학습한 특정 정보나 유해한 지식을 선택적으로 제거하는 과정이다. 전체 모델을 다시 학습시키지 않고도 특정 능력을 약화시키거나 편향을 수정할 때 사용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 06.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
