TL;DR
SFT 데이터에 고품질 CoT가 없으면 모델의 추론 능력이 심각하게 약화되는 사례가 관찰되어 이를 해결하기 위한 방법으로 Self-Distilled Reasoning(SDR)을 제안했다. SDR은 베이스 Amazon Nova 2 Lite가 생성한 chain-of-thought 토큰을 SFT 데이터에 증강하여 별도의 교사나 인간 주석 없이 모델 자신으로부터 추론 신호를 재주입하는 방식으로 작동하며 세 가지 벤치마크에서 검증되었다. 실험에서 vanilla SFT는 Math 성능을 평균 70%에서 6%로 급락시켰으나 SDR 적용 시 해당 성능을 거의 회복했고, model merging보다 목표 성능과 일반 성능을 동시에 더 잘 보존하거나 개선하는 결과가 보고되었다. 따라서 CoT가 없는 현실적 SFT 데이터에 대해 비용과 주석 부담 없이 추론 능력을 유지하면서 도메인 맞춤화를 수행할 수 있는 실용적 대안이 제시되었다.
섹션별 상세
이미지 분석

그래프는 vanilla SFT가 목표 성능을 얻는 동안 일반 성능을 크게 손실하는 반면 모델 병합은 손실을 일부 회복하지만 목표 성능 이득을 포기하는 경향을 보여준다. SDR은 목표 성능을 유지하거나 개선하면서도 일반 성능을 대부분 보존하는 영역에 위치하여 본문의 주장과 실험 결과를 시각적으로 보완한다. 이 이미지는 방법 간의 성능 트레이드오프와 SDR의 균형적 이점을 직관적으로 전달한다.
베이스, vanilla SFT, 모델 병합, SDR의 target 성능과 일반 성능 간 트레이드오프를 나타내는 도식적 비교 그래프이다.
용어 해설
- Chain-of-Thought (CoT)
- — 모델이 중간 추론 단계를 텍스트로 출력하여 복잡한 문제 해결 과정을 노출하는 기법으로, 입력에서 출력까지의 중간 논리흐름을 학습 데이터에 포함하면 문제 해결 능력이 향상된다. SFT에서 golden CoT가 있으면 모델이 난해한 수학·코딩 문제를 더 잘 푼다는 점이 핵심이다.
- Supervised Fine-Tuning (SFT)
- — 사전학습된 모델을 입력과 정답(또는 정답과 연계된 흔적) 쌍으로 추가 학습시키는 과정으로, 학습 데이터에 포함된 형식과 품질이 결과 성능에 직접적 영향을 준다. CoT가 누락된 데이터로 SFT를 수행하면 추론 능력 억제가 발생할 수 있다.
- Self-Distillation
- — 동일한 모델 또는 모델 계열의 출력(또는 내부 표현)을 학습 신호로 다시 사용하는 방법으로, 외부 교사 없이 모델의 지식을 재주입하여 학습 중 규제 효과를 얻는다. 본문에서는 베이스 모델의 CoT를 재생성하여 SFT 데이터에 증강하는 방식으로 적용되었다.
- Model Merging
- — SFT로 얻은 가중치와 원래의 베이스 모델을 어떤 방식으로든 결합하여 이전에 획득한 능력을 회복하려는 전략으로, 병합 방식에 따라 SFT에서 얻은 이득 일부를 포기할 위험이 존재한다. 본문에서는 병합이 target 성능과 일반 성능 사이의 트레이드오프를 초래한다고 보고되었다.
- Catastrophic Forgetting
- — 새로운 데이터로 추가 학습을 진행할 때 모델이 이전에 학습한 능력을 급격히 잃는 현상으로, 특정 도메인에 특화된 SFT가 수학과 같은 기존 능력을 거의 소실할 수 있다는 실험적 증거가 본문에 제시되었다. 이를 완화하는 방법이 연구의 주요 목적이었다.
근거 모음
- vanilla SFT에서 베이스의 Math 성능이 평균 70%에서 6%로 감소했다. — 본문 중 'For instance' 문단 및 Table 2
- SDR을 적용하면 베이스 수준의 Math 성능(약 70%)을 거의 완전히 회복할 수 있었다. — 실험 결과 요약 문단 및 비교 도표
- Self-distillation은 model merging과 비교해 유사한 수학 성능(70% 대 68%)을 보이면서 목표 성능을 6.5% 이상 개선했다. — 결론 문단 및 도표의 수치 비교
기술
- Amazon Nova 2
- Amazon Nova 2 Lite
- SFT
- RFT
활용 사례
- CoT가 없는 기존 SFT 데이터셋에 추론 토큰을 보강하여 도메인 맞춤화 수행
- 수학·코딩 등 고난도 문제에서 베이스 모델의 추론능력 보존
- 인적 라벨링 없이 비용 절감형 SFT 파이프라인 운영
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.