섹션별 상세
Atos는 이론 중심 교육의 한계를 극복하기 위해 실습과 경쟁이 결합된 AWS AI League를 도입하여 400명 이상의 활성 참여자와 4,100개 이상의 모델 생성을 이끌어냈다.
참가자들은 Amazon SageMaker Studio 내에서 Llama 3.2 3B Instruct 모델을 선택하고, 보험 언더라이팅 시나리오에 특화된 데이터셋을 구축하여 파인튜닝을 진행했다.

데이터셋 생성에는 PartyRock 애플리케이션이 활용되었으며, 참가자들은 Instruction-Response 쌍의 품질을 높이고 데이터 다양성을 확보하는 데 집중했다.
json
{
"instruction": "보험 언더라이터로서 다음 위험 요소를 분석하고 적절한 공제액을 추천하십시오.",
"response": "제시된 위험 요소에 기반하여, 해당 정책에는 $5,000의 공제액이 적절합니다. 이유는..."
}파인튜닝에 사용되는 JSON Lines(JSONL) 형식의 데이터셋 구조 예시
학습 과정에서 에포크(Epochs), 학습률(Learning Rate), LoRA 파라미터 등을 체계적으로 조정하며 모델의 성능 변화와 과적합(Overfitting) 현상을 직접 모니터링했다.
모델 평가는 Llama 3.2 90B 모델을 평가자로 사용하는 'LLM-as-a-Judge' 시스템을 통해 자동화되었으며, 보지 못한 87개의 질문에 대한 답변 품질로 순위를 결정했다.

최종 결과에서 상위권 참가자들의 3B 모델은 90B 모델 대비 93% 이상의 승률을 기록했으며, 이는 도메인 특화 데이터의 중요성을 입증하는 수치로 나타났다.

실무적으로 3B 모델은 ml.g5.4xlarge 인스턴스에서 구동 가능하여, 90B 모델이 필요로 하는 ml.g5.48xlarge 대비 인프라 비용을 획기적으로 절감했다.
용어 해설
- 미세 조정(Fine-tuning)
- — 사전 학습된 대규모 모델을 특정 도메인이나 작업에 특화된 소규모 데이터셋으로 추가 학습시키는 기법이다. 이를 통해 모델이 특정 산업 용어나 비즈니스 로직을 이해하도록 최적화하며, 처음부터 학습시키는 것보다 시간과 비용을 크게 절감한다.
- 판사로서의 LLM(LLM-as-a-Judge)
- — 더 크고 강력한 언어 모델(예: Llama 3.2 90B)을 사용하여 다른 모델이 생성한 답변의 품질, 정확성, 적절성을 자동으로 평가하는 방식이다. 사람이 일일이 검토하기 어려운 대규모 평가 작업을 빠르고 객관적으로 수행하기 위해 사용된다.
- 과적합(Overfitting)
- — 모델이 학습 데이터의 세부 사항과 노이즈까지 너무 완벽하게 암기하여, 학습하지 않은 새로운 데이터에 대해서는 제대로 대응하지 못하는 현상이다. 파인튜닝 과정에서 에포크(Epoch) 수가 너무 많거나 데이터가 다양하지 않을 때 발생하기 쉽다.
- 퍼플렉서티(Perplexity)
- — 언어 모델이 다음 단어를 예측할 때 얼마나 헷갈리는지를 나타내는 지표로, 모델의 불확실성을 측정한다. 값이 낮을수록 모델이 언어 패턴을 잘 학습하여 정확하게 예측하고 있음을 의미하며, 모델 성능 평가의 핵심 지표 중 하나다.
- 세이지메이커 점프스타트(SageMaker JumpStart)
- — 인프라 설정 없이 클릭 몇 번으로 오픈 소스 및 자체 파운데이션 모델을 배포, 학습, 파인튜닝할 수 있는 AWS의 머신러닝 허브다. 복잡한 코딩 없이도 최신 AI 모델을 비즈니스에 즉시 적용할 수 있는 환경을 제공한다.
기술
- Amazon SageMaker
- Amazon SageMaker JumpStart
- Llama 3.2
- PartyRock
- Amazon S3
활용 사례
- 지능형 보험 언더라이팅 보조 도구
- 도메인 특화 챗봇 구축
- 기업 내 AI 업스킬링 프로그램
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.