실용적 조언
- SFT 중 성능이 정체된다면 더 큰 교사 모델을 찾기보다 현재 모델의 이전 체크포인트를 활용해 로짓 믹싱을 시도해볼 것을 권장한다.
섹션별 상세
포화 병목 현상은 모델이 사후 학습 단계에서 특정 답변에 대해 지나치게 높은 확신을 가질 때 발생한다. 이 상태에서는 정답과 오답 토큰의 로짓이 모두 평탄해지며, 역전파 과정에서 가중치를 갱신할 그래디언트가 거의 생성되지 않는다. 결과적으로 추가 학습을 진행하더라도 모델의 성능이 실질적으로 향상되지 않는 정체기에 진입하게 된다.
WMSS(Weak-Model-driven Strong-model Steering) 방법론은 강한 모델과 약한 모델의 로짓을 혼합하여 이 문제를 해결한다. 먼저 베이스 모델을 SFT하여 강한 모델을 생성하고, 원본 베이스 모델을 약한 참조점으로 활용한다. 두 모델 사이의 엔트로피 변화를 추적하여 학습이 더 필요한 샘플을 선별하는 커리큘럼을 구성하고 공동 학습을 수행한다.
약한 모델이 제공하는 노이즈 섞인 예측은 강한 모델이 너무 일찍 닫아버린 결정 경계를 다시 열어주는 역할을 한다. 강한 모델이 이미 정답이라고 확신하는 영역에서도 약한 모델의 불확실성이 개입하면서 손실 함수의 지형이 재구성된다. 이를 통해 표준 SFT에서는 사라졌던 유의미한 그래디언트가 다시 활성화되어 추가적인 성능 개선이 가능해진다.
연구팀은 Qwen3-4B-Base 모델을 기반으로 수학 및 코딩 작업에서 WMSS의 효과를 검증했다. AIME2025를 포함한 수학 추론 벤치마크에서 표준 SFT 대비 일관된 성능 향상을 기록했으며, 코드 생성 능력도 강화됐다. 특히 약한 모델은 오직 학습 과정에서만 필요하므로 실제 서비스 배포 시 추가적인 연산 비용이나 지연 시간이 발생하지 않는다는 장점이 있다.
용어 해설
- 지도 미세 조정(SFT)
- — 미리 라벨링된 데이터를 사용하여 사전 학습된 모델을 특정 작업이나 지시사항에 맞춰 조정하는 과정이다. 모델이 사용자의 의도를 이해하고 적절한 형식을 갖추도록 하는 데 필수적인 단계이다.
- 로짓(Logit)
- — 신경망의 마지막 계층에서 출력되는 가공되지 않은 수치로, 소프트맥스 함수를 거치기 전의 값이다. 각 토큰이 선택될 확률의 기초가 되며, 특정 답변에 대한 모델의 확신 정도를 나타낸다.
- 그래디언트 소실(Gradient Vanishing)
- — 학습 과정에서 가중치를 업데이트하기 위한 기울기 값이 너무 작아져 모델이 더 이상 개선되지 않는 현상이다. 본문에서는 모델이 지나치게 확신을 가질 때 로짓이 평탄해지며 발생한다고 설명한다.
- 지식 증류(Knowledge Distillation)
- — 거대하고 성능이 좋은 교사 모델의 지식을 작고 효율적인 학생 모델에게 전달하는 학습 기법이다. 일반적으로 강한 모델에서 약한 모델로 흐르지만, 본 논문은 그 반대 방향의 유용성을 다룬다.
- 헤시안 행렬(Hessian Matrix)
- — 함수의 2계 도함수를 행렬로 나타낸 것으로, 손실 함수의 곡률을 분석하는 데 사용된다. 학습 정체 현상을 수학적으로 분석하고 최적화 경로를 이해하는 데 중요한 역할을 한다.
언급된 도구
Qwen3-4B-Base추천
실험에 사용된 베이스 언어 모델
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 17.수집 2026. 03. 17.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
