TL;DR
Amazon Nova 모델의 일반적인 추론 능력을 손상시키지 않으면서 특정 도메인에 최적화하는 파인튜닝 기법인 데이터 믹싱의 실무 적용 방법을 다룬다. Nova Forge SDK를 사용하여 데이터 준비, LoRA 기반 학습 설정, 그리고 데이터 혼합 비율 조정 과정을 단계별로 제시한다. 실제 테스트 결과, 고객 데이터만 학습했을 때 MMLU 점수가 0.75에서 0.47로 급락한 반면, 데이터 믹싱을 적용하면 0.74 수준을 유지하면서도 도메인 F1 점수를 12포인트 향상시켰다. 이 가이드는 SageMaker HyperPod 인프라를 활용한 효율적인 학습과 MLflow를 통한 실험 관리 및 다차원 평가 체계를 포함한다.
배경
AWS 계정 및 Amazon Nova Forge 접근 권한, SageMaker HyperPod 클러스터 (GPU 인스턴스), Python 및 Jupyter Notebook 환경 지식, 기본적인 LLM 파인튜닝 및 LoRA 개념 이해
대상 독자
AWS 환경에서 Amazon Nova 모델을 사용하여 도메인 특화 LLM을 구축하려는 머신러닝 엔지니어 및 솔루션 아키텍트
의미 / 영향
이 가이드는 기업들이 자체 데이터를 학습시킬 때 겪는 가장 큰 문제인 '모델의 바보화(지능 저하)'를 해결할 수 있는 구체적인 방법론을 제시합니다. Nova Forge SDK의 데이터 믹싱 기능을 통해 고성능 도메인 모델을 안전하게 구축할 수 있게 됨으로써, 금융, 의료 등 전문 지식이 필요한 산업군에서 LLM 도입 장벽이 크게 낮아질 것으로 예상됩니다.
섹션별 상세
- 데이터 믹싱을 적용한 75/25 비율 학습 시 MMLU 점수를 베이스라인(0.75)에 근접한 0.74로 유지하면서 도메인 F1 점수를 12포인트 향상시켰다. — Understand and tune the data mixing configuration 섹션 및 마지막 결과 비교 차트
customizer = NovaModelCustomizer(
model=Model.NOVA_LITE_2,
method=TrainingMethod.SFT_LORA,
infra=runtime,
data_s3_path=f"{S3_DATA_PATH}/train.jsonl",
output_s3_path=f"{S3_OUTPUT_PATH}/",
mlflow_monitor=mlflow_monitor,
data_mixing_enabled=True,
)데이터 믹싱 기능을 활성화하여 Nova 모델 커스터마이저 객체를 생성하는 예시
customizer.set_data_mixing_config({
"customer_data_percent": 50,
"nova_instruction-following_percent": 13,
"nova_reasoning-instruction-following_percent": 45,
"nova_baseline_percent": 10,
})사용자 데이터와 Amazon 큐레이션 데이터 간의 혼합 비율을 설정하는 예시

- 고객 데이터로만 파인튜닝할 경우 MMLU 점수가 0.75에서 0.47로 급격히 하락하여 일반 지능을 상실한다. — Interpreting your results 섹션의 VOC 분류 작업 결과 보고
용어 해설
- Data Mixing
- — 도메인 특화 데이터와 모델의 일반 능력을 유지하기 위한 범용 데이터를 특정 비율로 혼합하여 학습시키는 기법이다. 파인튜닝 시 모델이 특정 지식만 배우느라 기존의 일반적인 추론 능력을 잃어버리는 '파괴적 망각' 현상을 방지하는 데 핵심적인 역할을 한다.
- LoRA
- — 모델의 전체 가중치를 업데이트하는 대신 일부 저순위 행렬만을 학습시키는 매개변수 효율적 파인튜닝(PEFT) 기법이다. 학습에 필요한 계산 자원과 메모리를 획기적으로 줄이면서도 전체 파인튜닝에 근접하는 성능을 낼 수 있어 실무에서 널리 사용된다.
- Catastrophic Forgetting
- — 신경망이 새로운 정보를 학습할 때 이전에 학습했던 정보를 급격히 잊어버리는 현상이다. LLM 파인튜닝 시 특정 도메인 데이터에만 집중하면 모델의 전반적인 언어 이해나 논리적 추론 능력이 손상되는 결과로 나타난다.
- MMLU
- — 57개의 다양한 주제를 통해 모델의 지식과 문제 해결 능력을 측정하는 대표적인 AI 벤치마크이다. 파인튜닝 후 모델의 일반적인 지능 수준이 유지되었는지 판단하는 핵심 지표로 활용된다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.