본문으로 건너뛰기
AWS ML Blog조회 2

Amazon Bedrock의 Nova 모델 증류를 통한 비디오 시맨틱 검색 의도 최적화

Amazon Bedrock의 모델 증류 기능을 활용해 거대 모델의 검색 의도 파악 능력을 소형 모델로 전이함으로써 비디오 검색 시스템의 비용과 지연 시간을 획기적으로 개선했다.

섹션별 상세

비디오 검색 시스템의 의도 라우팅 단계에서 발생하는 높은 지연 시간이 전체 사용자 경험의 병목 구간으로 작용했다. 기존 Claude Haiku 모델을 사용한 라우팅은 정확하지만 전체 검색 시간의 약 75%인 2~4초를 차지하는 한계가 있었다. 이를 해결하기 위해 정확도는 유지하면서 속도와 비용을 최적화할 수 있는 모델 커스터마이징이 필요했다.
비디오 검색 시스템의 엔드투엔드 쿼리 지연 시간 분석 차트
Chart전체 검색 과정에서 전처리(Preprocessing) 단계가 약 1,605ms를 차지하여 전체 지연 시간의 상당 부분을 점유하고 있음을 보여준다. 이는 의도 라우팅 모델의 최적화가 전체 시스템 성능 개선에 필수적임을 시각적으로 뒷받침한다.
Amazon Bedrock의 모델 증류 기능을 통해 고성능 교사 모델의 지식을 효율적인 학생 모델로 전이하는 파이프라인을 구축했다. Nova Premier를 교사 모델로, Nova Micro를 학생 모델로 설정하여 10,000개의 시각·오디오·텍스트 가중치 레이블 데이터를 학습시켰다. 이 과정은 별도의 인프라 관리나 하이퍼파라미터 튜닝 없이 Bedrock 관리형 서비스로 자동화되어 수행됐다.
python
response = bedrock_client.create_model_customization_job(
    jobName=job_name,
    customModelName=model_name,
    roleArn=distillation_role_arn,
    baseModelIdentifier=student_model,
    customizationType="DISTILLATION",
    trainingDataConfig={"s3Uri": training_s3_uri},
    outputDataConfig={"s3Uri": output_s3_uri},
    customizationConfig={
        "distillationConfig": {
            "teacherModelConfig": {
                "teacherModelIdentifier": teacher_model,
                "maxResponseLengthForInference": 1000
            }
            }
        }
    )

Amazon Bedrock에서 교사 모델(Nova Premier)과 학생 모델(Nova Micro)을 지정하여 모델 증류 학습 작업을 생성하는 코드

10,000개 학습 예제의 모달리티별 가중치 분포 히스토그램
ChartVisual, Audio, Transcription, Metadata 등 4가지 모달리티에 대한 학습 데이터의 가중치 분포를 보여준다. 데이터가 특정 값에 치우치지 않고 고르게 분포되어 있어 모델이 다양한 검색 의도를 학습할 수 있는 양질의 데이터셋임을 입증한다.
증류된 Nova Micro 모델은 기본 모델 대비 지시 이행 능력이 비약적으로 향상되었으며 일관된 JSON 출력을 보장했다. 기본 모델은 자유 형식의 텍스트나 불완전한 JSON을 출력하는 반면, 증류 모델은 정의된 스키마에 맞춰 4개 모달리티의 가중치 합이 1.0이 되는 수치 데이터를 정확히 반환했다. 이는 복잡한 엔터프라이즈 메타데이터 라우팅 환경에서 필수적인 신뢰성을 제공한다.
성능 평가 결과 증류된 모델은 대형 모델 수준의 품질을 유지하면서도 운영 지표에서 압도적인 우위를 점했다. LLM-as-judge 평가에서 5점 만점에 4.0점을 기록하여 Claude Haiku와 대등한 품질을 보였으나, 평균 지연 시간은 1,741ms에서 833ms로 절반 이하로 줄었다. 특히 토큰당 비용 측면에서 95% 이상의 절감 효과를 거두어 대규모 프로덕션 환경에 적합함을 증명했다.
증류된 Nova Micro와 Claude Haiku의 품질 점수 및 평균 지연 시간 비교 그래프
Chart두 모델의 품질 점수는 4.0으로 동일하지만, 평균 지연 시간은 증류된 Nova Micro(833ms)가 Claude Haiku(1,741ms)보다 두 배 이상 빠르다는 실험 결과를 명확히 보여준다.
근거
  • 모델 증류를 통해 추론 비용을 95% 이상 절감하고 지연 시간을 50% 단축했다. Solution overview 섹션 및 Conclusion 섹션의 수치 언급
  • 증류된 Nova Micro 모델은 LLM-as-judge 평가에서 5점 만점에 4.0점을 기록했다. Evaluate the distilled model 섹션의 Figure 3 및 테이블 데이터

용어 해설

모델 증류(Model Distillation)
거대하고 성능이 뛰어난 '교사(Teacher)' 모델의 지식을 작고 효율적인 '학생(Student)' 모델로 전이시키는 기법이다. 학생 모델은 교사 모델의 출력 패턴을 학습함으로써, 훨씬 적은 파라미터로도 교사 모델에 근접한 추론 능력을 갖추게 되어 비용과 지연 시간을 획기적으로 줄일 수 있다.
시맨틱 검색(Semantic Search)
단순한 키워드 매칭을 넘어 사용자의 검색 의도와 단어 간의 의미론적 관계를 파악하여 결과를 제공하는 기술이다. 비디오 검색에서는 영상의 시각적 요소, 오디오, 자막 등 다양한 모달리티의 의미를 종합적으로 분석하여 가장 관련성 높은 구간을 찾아내는 데 사용된다.
의도 기반 라우팅(Intent Routing)
사용자의 쿼리를 분석하여 어떤 데이터 소스나 처리 로직(모달리티)이 가장 적합한지 판단하고 할당하는 과정이다. 예를 들어 '대화 내용' 검색 시에는 텍스트 전사 데이터에 높은 가중치를 부여하도록 경로를 지정함으로써 검색의 정확도와 효율성을 높인다.

기술

  • Amazon Bedrock
  • Amazon Nova Premier
  • Amazon Nova Micro
  • Claude Haiku
  • Python
  • Boto3

활용 사례

  • 비디오 시맨틱 검색 라우팅
  • 다중 모달리티 데이터 분석
  • LLM 기반 의도 파악 시스템 최적화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 18.수집 2026. 04. 18.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.