본문으로 건너뛰기

AWS AI League: Atos의 AI 교육 혁신과 LLM 파인튜닝 실전 사례

Atos는 AWS AI League를 통해 400명 이상의 직원을 교육하고, SageMaker JumpStart를 활용한 파인튜닝으로 소형 모델이 특정 도메인에서 대형 모델을 능가하는 성과를 거두었다.

섹션별 상세

Atos는 이론 중심 교육의 한계를 극복하기 위해 실습과 경쟁이 결합된 AWS AI League를 도입하여 400명 이상의 활성 참여자와 4,100개 이상의 모델 생성을 이끌어냈다.
참가자들은 Amazon SageMaker Studio 내에서 Llama 3.2 3B Instruct 모델을 선택하고, 보험 언더라이팅 시나리오에 특화된 데이터셋을 구축하여 파인튜닝을 진행했다.
파운데이션 모델(FM) 커스터마이징이 중요한 이유를 4가지 핵심 요소로 정리한 인포그래픽이다.
Infographic비즈니스 요구사항 맞춤화, 도메인 특화 언어 적응, 특정 작업 성능 향상, 답변의 문맥 인식 개선을 파인튜닝의 주요 목적으로 제시한다. 이는 Atos가 왜 범용 모델 대신 파인튜닝을 선택했는지에 대한 기술적 배경을 설명한다.
데이터셋 생성에는 PartyRock 애플리케이션이 활용되었으며, 참가자들은 Instruction-Response 쌍의 품질을 높이고 데이터 다양성을 확보하는 데 집중했다.
json
{
  "instruction": "보험 언더라이터로서 다음 위험 요소를 분석하고 적절한 공제액을 추천하십시오.",
  "response": "제시된 위험 요소에 기반하여, 해당 정책에는 $5,000의 공제액이 적절합니다. 이유는..."
}

파인튜닝에 사용되는 JSON Lines(JSONL) 형식의 데이터셋 구조 예시

학습 과정에서 에포크(Epochs), 학습률(Learning Rate), LoRA 파라미터 등을 체계적으로 조정하며 모델의 성능 변화와 과적합(Overfitting) 현상을 직접 모니터링했다.
모델 평가는 Llama 3.2 90B 모델을 평가자로 사용하는 'LLM-as-a-Judge' 시스템을 통해 자동화되었으며, 보지 못한 87개의 질문에 대한 답변 품질로 순위를 결정했다.
Amazon SageMaker JumpStart를 활용한 모델 파인튜닝 및 배포 워크플로우 다이어그램이다.
DiagramS3 데이터 준비부터 하이퍼파라미터 설정, 학습 시작, 모델 평가, 반복 개선을 거쳐 리더보드에 배포되는 전체 생명주기를 보여준다. 참가자들이 실제 수행한 기술적 프로세스를 시각적으로 요약하고 있다.
최종 결과에서 상위권 참가자들의 3B 모델은 90B 모델 대비 93% 이상의 승률을 기록했으며, 이는 도메인 특화 데이터의 중요성을 입증하는 수치로 나타났다.
AWS AI League에 참여한 Atos의 주요 성과 지표와 평가 방식에 대한 요약이다.
Infographic409명의 활성 참여자가 4,100개 이상의 모델을 생성했으며, LLM-as-a-Judge 방식을 통해 87개의 질문으로 평가했음을 명시한다. 상위 5명이 90% 이상의 승률을 기록했다는 구체적인 성과 수치를 포함한다.
실무적으로 3B 모델은 ml.g5.4xlarge 인스턴스에서 구동 가능하여, 90B 모델이 필요로 하는 ml.g5.48xlarge 대비 인프라 비용을 획기적으로 절감했다.

용어 해설

미세 조정(Fine-tuning)
사전 학습된 대규모 모델을 특정 도메인이나 작업에 특화된 소규모 데이터셋으로 추가 학습시키는 기법이다. 이를 통해 모델이 특정 산업 용어나 비즈니스 로직을 이해하도록 최적화하며, 처음부터 학습시키는 것보다 시간과 비용을 크게 절감한다.
판사로서의 LLM(LLM-as-a-Judge)
더 크고 강력한 언어 모델(예: Llama 3.2 90B)을 사용하여 다른 모델이 생성한 답변의 품질, 정확성, 적절성을 자동으로 평가하는 방식이다. 사람이 일일이 검토하기 어려운 대규모 평가 작업을 빠르고 객관적으로 수행하기 위해 사용된다.
과적합(Overfitting)
모델이 학습 데이터의 세부 사항과 노이즈까지 너무 완벽하게 암기하여, 학습하지 않은 새로운 데이터에 대해서는 제대로 대응하지 못하는 현상이다. 파인튜닝 과정에서 에포크(Epoch) 수가 너무 많거나 데이터가 다양하지 않을 때 발생하기 쉽다.
퍼플렉서티(Perplexity)
언어 모델이 다음 단어를 예측할 때 얼마나 헷갈리는지를 나타내는 지표로, 모델의 불확실성을 측정한다. 값이 낮을수록 모델이 언어 패턴을 잘 학습하여 정확하게 예측하고 있음을 의미하며, 모델 성능 평가의 핵심 지표 중 하나다.
세이지메이커 점프스타트(SageMaker JumpStart)
인프라 설정 없이 클릭 몇 번으로 오픈 소스 및 자체 파운데이션 모델을 배포, 학습, 파인튜닝할 수 있는 AWS의 머신러닝 허브다. 복잡한 코딩 없이도 최신 AI 모델을 비즈니스에 즉시 적용할 수 있는 환경을 제공한다.

기술

  • Amazon SageMaker
  • Amazon SageMaker JumpStart
  • Llama 3.2
  • PartyRock
  • Amazon S3

활용 사례

  • 지능형 보험 언더라이팅 보조 도구
  • 도메인 특화 챗봇 구축
  • 기업 내 AI 업스킬링 프로그램
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.