챕터별 상세
00:00
미드트레이닝의 정의와 연구 배경
미드트레이닝은 일반적인 사전 학습과 특정 태스크를 위한 사후 학습(SFT) 사이의 중간 단계를 의미한다. 기존 LLM 개발에서는 이 단계의 효과에 대한 체계적인 이해가 부족했다. 본 연구는 미드트레이닝이 데이터 분포의 가교(Distributional Bridge) 역할을 하여 사후 학습을 위한 더 나은 초기화 상태를 제공한다는 가설을 검증했다.
10:00
실험 설계 및 데이터 믹싱 전략
Pythia 모델군(70M~1B)을 사용하여 C4 웹 데이터와 특정 도메인(코드, 수학, 지식 QA) 데이터를 혼합하여 실험을 진행했다. StarCoder, MATH, FLAN 등 5가지 미드트레이닝 믹스를 구성하여 학습 시점과 혼합 비율에 따른 변화를 측정했다. 일반 사전 학습 데이터를 완전히 배제하지 않고 일정 비율 유지하는 것이 성능 유지의 핵심 요소였다.
20:00
검증 손실 분석 및 도메인별 효과
미드트레이닝은 코드나 수학처럼 일반 사전 학습 데이터와 분포 차이가 큰 도메인에서 가장 큰 효과를 보였다. 실험 결과, 미드트레이닝을 거친 모델은 사후 학습 단계에서 더 낮은 검증 손실을 기록하며 빠르게 수렴했다. 이는 미드트레이닝이 모델을 타겟 분포에 더 가깝게 이동시켜 최적화 경로를 부드럽게 만들었기 때문이다.
30:00
학습 시점과 모델 가소성의 관계
학습 초기(약 12B 토큰 시점)에 도메인 데이터를 도입하는 것이 후기(105B 토큰 시점)보다 훨씬 효과적이었다. 모델의 가중치가 고정되기 전인 초기에 높은 비율의 도메인 데이터를 섞는 것이 성능 향상에 유리했다. 학습 후기에 데이터를 대량으로 투입하는 방식은 모델의 가소성 부족으로 인해 초기 투입 방식의 성능을 따라잡지 못했다.
40:00
CKA 분석을 통한 내부 표현 안정성 검증
CKA(Centered Kernel Alignment) 분석을 통해 모델 내부 표현의 변화를 시각화했다. 미드트레이닝을 거친 모델은 사후 학습 후에도 표현의 안정성이 더 높게 나타났다. 이는 미드트레이닝이 급격한 분포 변화로 인한 파괴적 망각을 방지하고 지식을 점진적으로 축적하게 함을 입증했다.
50:00
결론 및 실무적 시사점
미드트레이닝은 단순한 성능 향상 도구가 아니라 LLM 학습 파이프라인의 필수적인 단계로 고려되어야 한다. 특히 도메인 특화 모델을 개발할 때 사전 학습 단계부터 전략적으로 데이터를 섞는 것이 중요하다. 연구 결과는 적절한 시점의 데이터 믹싱이 모델의 최종 성능을 결정짓는 핵심 변수임을 보여주었다.
용어 해설
- 중간 학습(Midtraining)
- — 사전 학습(Pretraining)과 사후 학습(Posttraining/SFT) 사이의 중간 단계에서 도메인 특화 데이터를 섞어 학습하는 기법이다. 일반적인 사전 학습 데이터와 타겟 도메인 데이터 간의 분포 격차를 줄여 모델이 특정 태스크에 더 잘 적응하도록 돕는 가교 역할을 한다.
- 분포적 가교(Distributional Bridge)
- — 서로 다른 데이터 분포를 가진 학습 단계 사이를 연결하여 모델이 급격한 변화 없이 타겟 분포로 이동할 수 있게 돕는 메커니즘이다. 미드트레이닝이 이 역할을 수행하며, 사후 학습을 위한 최적의 가중치 초기화 상태를 제공하여 성능을 높인다.
- 가소성(Plasticity)
- — 신경망 모델이 새로운 정보를 학습하고 기존의 가중치를 유연하게 조정할 수 있는 능력이다. 학습이 진행될수록 모델의 가소성은 줄어드는 경향이 있으며, 본 연구에서는 가소성이 높은 학습 초기에 도메인 데이터를 도입하는 것이 더 효과적임을 입증했다.
- 중심 커널 정렬(CKA (Centered Kernel Alignment))
- — 두 신경망 레이어 간의 표현 유사도를 측정하여 모델 내부의 지식 구조가 어떻게 변화하는지 분석하는 지표이다. 미드트레이닝 전후의 모델 내부 표현 변화를 시각화하고 안정성을 검증하는 데 사용되어 학습의 질을 평가하는 도구가 된다.
- 파괴적 망각(Catastrophic Forgetting)
- — 모델이 새로운 데이터를 학습할 때 이전에 학습했던 일반적인 지식을 급격하게 잊어버리는 현상이다. 미드트레이닝은 일반 데이터와 도메인 데이터를 적절히 혼합함으로써 이러한 망각을 억제하고 모델의 범용 지능을 유지하는 데 기여한다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

