본문으로 건너뛰기

지능 저하 없는 특화 AI 구축: Nova Forge 데이터 믹싱 활용 사례

Amazon Nova Forge의 데이터 믹싱 기법을 통해 모델의 범용 지능을 유지하면서도 특정 도메인 성능을 획기적으로 높이는 방법을 제시합니다.

섹션별 상세

01
Nova Forge의 핵심 기능과 데이터 믹싱: Nova Forge는 사용자가 Nova 모델을 기반으로 자체 프론티어 모델을 구축할 수 있게 돕는 서비스다. 특히 고객의 데이터와 Amazon이 큐레이션한 데이터를 혼합하여 학습시키는 기능을 제공하여 모델의 범용성을 보존한다.
베이스 모델에서 데이터 믹싱을 적용한 타겟 상태까지의 모델 발전 단계를 보여주는 다이어그램
Diagram단순 SFT는 도메인 성능은 높이지만 범용 지능을 잃게 만든다. 마지막 단계인 Data Mixing이 적용된 상태가 도메인 전문성과 범용 지능을 모두 유지하는 목표 지점임을 시각화한다.
02
VOC 분류 작업의 복잡성과 도전 과제: 1,420개의 세부 카테고리를 가진 4단계 계층 구조의 고객 피드백 데이터를 분류하는 실험을 진행했다. 데이터의 44.5%가 샘플 5개 미만인 극심한 불균형 상태였으며, 이는 일반적인 파운데이션 모델이 처리하기 매우 어려운 수준이다.
1,420개 카테고리에 걸친 VOC 데이터셋의 클래스 분포 도넛 차트
Chart데이터의 44.5%가 5개 미만의 샘플을 가진 극심한 롱테일 분포를 보여준다. 이는 모델이 학습하기 매우 까다로운 실제 기업 데이터의 불균형성을 증명한다.
03
파멸적 망각 현상의 실증적 확인: 고객 데이터로만 전체 파라미터 SFT를 진행했을 때, Nova 2 Lite 모델의 MMLU 점수는 0.75에서 0.47로 급락했다. 오픈소스 모델인 Qwen3-30B의 경우 지시 이행 능력을 거의 상실하는 등 특정 도메인 학습이 범용 지능을 심각하게 훼손함을 확인했다.
04
데이터 믹싱을 통한 성능 균형 달성: 고객 데이터 75%와 Nova 큐레이션 데이터 25%를 혼합하여 학습시킨 결과, VOC 분류 F1 스코어는 0.38에서 0.50으로 상승했다. 동시에 MMLU 점수는 0.74를 기록하여 베이스라인(0.75)과 거의 차이가 없는 수준으로 범용 지능을 방어했다.
json
[
  {
    "content": "",
    "L1": "",
    "L2": "",
    "L3": "",
    "L4": "",
    "emotion": ""
  }
]

VOC 분류 작업을 위해 모델이 출력해야 하는 JSON 스키마 구조

고객 데이터 75%와 Nova 큐레이션 데이터 25%를 혼합하는 데이터 믹싱 개념도
Infographic두 종류의 데이터를 특정 비율로 혼합하여 학습시켰을 때 도메인 전문성과 범용 지능이라는 두 마리 토끼를 모두 잡을 수 있다는 핵심 방법론을 설명한다.

용어 해설

파멸적 망각(Catastrophic Forgetting)
신경망 모델이 새로운 특정 도메인의 지식을 학습하는 과정에서 이전에 학습했던 일반적인 지식이나 능력을 완전히 잃어버리는 현상이다. 모델이 특정 작업에 과적합되면서 발생하며, 이를 방지하기 위해 기존 데이터와 새 데이터를 혼합하는 기법이 사용된다.
지도 미세 조정(SFT)
사전 학습된 모델을 특정 작업에 적합하도록 레이블이 지정된 데이터셋을 사용하여 추가 학습시키는 기법이다. 모델의 응답 형식을 지정하거나 특정 도메인의 전문성을 높이는 데 필수적인 과정이다.
대규모 다중작업 언어 이해(MMLU)
인문학, 사회과학, 수학 등 57개 주제를 포함하는 벤치마크로, LLM의 전반적인 지식과 추론 능력을 측정하는 표준 지표다. 모델의 범용 지능 유지 여부를 판단하는 척도로 널리 활용된다.
매개변수 효율적 미세 조정(PEFT)
전체 파라미터를 업데이트하는 대신 일부 가중치만 수정하여 모델을 튜닝하는 방식이다. 학습 비용과 메모리 사용량을 크게 줄일 수 있지만, 전체 파라미터를 튜닝하는 Full-rank SFT에 비해 도메인 특화 성능은 낮을 수 있다.

기술

  • Amazon Nova Forge
  • Amazon Nova 2 Lite
  • Amazon SageMaker HyperPod
  • vLLM

활용 사례

  • 고객 상담(VOC) 자동 분류 시스템
  • 도메인 특화 지식 기반의 챗봇
  • 복잡한 계층 구조를 가진 데이터 라벨링

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 03.수집 2026. 03. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.