챕터별 상세
00:00
대회 배경 및 팀 EPICURUS 소개
Learning Equality 조직이 주최한 이 대회는 저사양 인프라와 오프라인 환경에서 교육 자료를 효율적으로 배포하기 위해 기획됐다. 우승 팀인 EPICURUS의 Ahmet Erdem은 컴퓨터 공학 배경의 Kaggle 그랜드마스터로, 시맨틱 유사도 매칭 기술을 활용해 솔루션을 구축했다. 대회 데이터는 다국어로 구성된 STEM 주제의 교육 콘텐츠와 이를 분류하는 커리큘럼 트리 구조로 이루어졌다.
08:58
검증 전략 및 데이터 표현 방식
Kaggle의 실제 테스트 셋과 유사한 환경을 만들기 위해 2단계 검증 스키마를 구축했다. 소스 토픽과 무작위로 선택된 토픽을 분리하여 로컬 검증 점수와 리더보드 점수 간의 상관관계를 높였다. 토픽 표현 시 부모 토픽의 제목을 최대 3단계까지 '@' 기호로 연결하여 트리의 계층 구조 정보를 모델이 학습할 수 있도록 설계했다. 콘텐츠의 경우 제목, 종류(연습문제, 비디오 등), 설명을 결합하여 표현했다.
계층 구조를 텍스트로 직렬화하는 방식은 그래프 구조를 Transformer 모델이 이해하도록 돕는 일반적인 기법이다.
python
def get_topic_representation(topic_df):
# 부모 토큰들을 @ 기호로 연결하여 계층 구조 반영
topic_df['representation'] = topic_df['parent_title'] + " @ " + topic_df['title'] + " @ " + topic_df['description']
return topic_df커리큘럼의 계층 구조를 반영하기 위해 부모 제목과 현재 제목, 설명을 특정 구분자로 결합하는 텍스트 표현 방식
11:40
후보군 추출(Candidate Selection) 기법
전체 데이터 셋에서 매칭 가능성이 높은 후보를 추리기 위해 네 가지 검색 방식을 병용했다. 첫째로 동일한 제목이나 부모를 가진 토픽의 콘텐츠를 추출하는 규칙 기반 방식을 사용했다. 둘째로 문자 4-gram 기반의 TF-IDF를 활용해 다국어 노이즈에 강한 유사도 검색을 수행했다. 셋째로 Transformer 모델을 이용해 시맨틱 유사도가 높은 상위 20개 콘텐츠를 추출했다. 마지막으로 토픽 간 유사도를 계산하여 유사한 토픽의 콘텐츠를 가져오는 2차 매칭 기법을 적용했다.
13:18
Transformer 모델 학습 및 ArcFace 적용
Paraphrase-multilingual-MiniLM, BERT-base, MPNet, XLM-RoBERTa 등 다양한 백본 모델을 앙상블했다. 학습 시 ArcFace 손실 함수를 적용하여 콘텐츠 클래스 간의 거리를 각도 마진으로 분리함으로써 변별력을 높였다. 입력 시퀀스 길이는 64로 제한하되, 제목 정보가 포함된 앞부분 32개 토큰의 출력값만 평균 풀링(Mean Pooling)하여 임베딩으로 사용했다. 나머지 32개 토큰은 설명 정보를 제공하는 컨텍스트 역할만 수행하도록 설계하여 제목의 중요도를 강조했다.
ArcFace는 원래 얼굴 인식에서 사용되던 기법으로, 임베딩 공간에서 클래스 간 경계를 명확히 하는 데 효과적이다.
17:23
피처 엔지니어링 및 LightGBM 모델링
추출된 후보군에 대해 이진 분류를 수행하기 위해 LightGBM 모델을 구축했다. 주요 피처로는 TF-IDF 점수, 벡터 코사인 거리, 토픽별 최소/최대/평균 거리 등의 집계 피처를 생성했다. 또한 '동일한 챕터 번호 포함 여부', '동일한 단어로 시작 여부'와 같은 이진 피처를 추가하여 텍스트의 구조적 일치성을 반영했다. 모델 학습 시에는 매칭된 샘플(Hit)에 가중치를 부여하고, 코사인 거리에 대해 단조 제약(Monotonic Constraint)을 설정하여 안정성을 높였다.
21:26
후처리 및 효율성 모델 전략
최종 예측 시 단순 임계값 대신 상대적 확률 차이를 이용한 후처리를 적용했다. 가장 높은 확률을 가진 콘텐츠와의 격차(Gap)를 계산하여 일정 범위 내에 있는 후보들만 최종 선택했다. 효율성 트랙(Efficiency Track)을 위해 MiniLM 백본 하나만 사용한 경량 모델을 개발했으며, 이는 CPU 환경에서 단 20분 만에 추론을 완료하면서도 리더보드 상위권의 성능을 기록했다. 데이터 내의 중복 토픽 문제와 그래프 구조 학습의 중요성을 발견하며 발표를 마무리했다.
용어 해설
- 단어 빈도-역문서 빈도(TF-IDF)
- — 텍스트 마이닝에서 여러 문서로 구성된 문서군이 있을 때 어떤 단어가 특정 문서 내에서 얼마나 중요한 것인지를 나타내는 통계적 수치이다. 단어의 빈도와 역문서 빈도를 곱하여 계산하며, 정보 검색과 텍스트 마이닝에서 가중치로 사용된다.
- 아크페이스(ArcFace)
- — 대규모 분류 문제에서 클래스 간의 분별력을 높이기 위해 각도 마진(Additive Angular Margin)을 사용하는 손실 함수이다. 주로 얼굴 인식 모델에서 사용되지만, 이 대회에서는 텍스트 임베딩 간의 유사도를 극대화하여 매칭 성능을 높이는 데 적용됐다.
- 평균 풀링(Mean Pooling)
- — Transformer 모델의 각 토큰별 출력 벡터들을 평균 내어 문장 전체를 대표하는 하나의 고정 길이 벡터를 생성하는 기법이다. 문장의 전반적인 의미 정보를 압축하여 임베딩을 생성할 때 널리 사용된다.
- F2 점수(F2-Score)
- — 정밀도(Precision)와 재현율(Recall)의 가중 조화 평균으로, 재현율에 정밀도보다 2배 더 높은 가중치를 부여하는 지표이다. 누락된 매칭을 찾는 것이 정확한 매칭을 찾는 것보다 중요한 상황에서 성능을 평가하기 위해 사용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 25.수집 2026. 02. 25.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.