TL;DR
서로 다른 규칙 체계가 공존하는 이질적 도메인에서 인간 설계 휴리스틱이 모델에 그대로 반영되는 문제를 피하기 위해 작성자는 XGBoost 분류기와 LLM을 블라인드 라벨러로 결합한 파이프라인을 구현했다. LLM은 캐릭터 이름과 원칙 정보만 보고 2,300개가 넘는 매치업의 승패 라벨을 생성했고 XGBoost는 그 라벨로부터 자체적인 피처 가중치를 학습했다. 훈련/검증 분할에서 발견된 데이터 누수를 제거한 후 깨끗한 홀드아웃에서 93%의 정확도가 보고되었고, SHAP로 산출한 기여도를 제한된 제약과 함께 LLM에 입력해 수학적 근거 기반의 자연어 설명을 생성하는 계층을 더해 설명 가능성을 확보했다. 저장소와 라이브 데모가 공개되어 연구 재현과 추가 검증이 가능하며 LLM 라벨러의 잠재적 편향은 별도 검증이 필요한 한계로 남아 있다.
실용적 조언
- 훈련 전 train/test 분할에서 매치업 식별자나 조합 키를 기준으로 중복 검사를 수행해야 한다. 동일 매치업이 양측 집합에 분산된 경우 데이터 누수로 이어질 수 있고 이는 성능 지표를 왜곡한다. 자동화된 중복 탐지 스크립트를 파이프라인 초기 단계에 배치하는 것이 안전하다.
- 라벨을 외부 모델(예: LLM)로 생성할 때는 라벨의 생성 조건과 입력 제한을 명확히 기록해야 한다. 라벨러가 어떤 정보를 보았고 보지 않았는지 로그로 남겨라. 라벨 품질 평가는 인간 검증 표본과 통계적 일관성 검사로 병행해야 한다.
- 해석 가능성을 위해 SHAP와 같은 수치적 기여도 산출 후 그 값을 제약된 자연어 생성 계층으로 변환하는 절차를 도입할 수 있다. 수치→제약된 템플릿→생성 모델 순서로 파이프라인을 구성하면 수학적 근거를 유지하면서 설명 가독성을 확보할 수 있다.
섹션별 상세
이미지 분석

이 이미지는 파이프라인 입력 분포를 시각적으로 확인할 수 있게 하며 여러 캐릭터와 규칙 세트가 어떻게 정렬되어 있는지 보여준다. 다양한 원천 규칙과 캐릭터 조합이 후보군으로 존재함을 통해 합성 라벨링과 학습 데이터의 이질성이 확보되었음을 추정할 수 있다. 입력 다양성은 모델 일반화 평가에 중요한 전제 조건으로 작용한다.
선택 화면과 캐릭터 카드가 나열된 애플리케이션 UI 스크린샷으로, 모델이 예측 대상으로 삼는 다양한 엔티티와 원천 규칙 세트를 보여준다.

이 화면은 파이프라인의 출력 구성요소를 직접 보여주며 최종 승자와 신뢰도 수치가 명시되어 있다. 결정 요인 섹션에는 속도·시간·내구성 등 개별 기여 항목과 정량적 기여치가 나열되어 있어 SHAP와 유사한 기여도 기반의 결정을 시각적으로 확인할 수 있다. 따라서 이 이미지는 모델의 예측 결과와 설명 가능성 구현의 산출물을 동시에 보여주는 증거 역할을 한다.
배틀 분석 텍스트와 승자, 신뢰도 수치(예: Satoru Gojo 승리 75.4%) 및 결정 요인 목록을 포함한 결과 화면 스크린샷이다.

이 이미지는 입력 공간의 크기와 다양성을 시각적으로 보여줘 합성 라벨링 과정에서 LLM이 처리해야 하는 조합 수의 규모를 가늠하게 한다. 후보군의 다양성은 모델이 특정 규칙군에 과도하게 적합되는 것을 방지하는 데 필요한 데이터 분포의 폭을 제공한다. 따라서 이미지 전체는 파이프라인의 문제 설정과 데이터 생성 의도를 보완하는 근거로 작용한다.
좌우 두 플레이어의 캐릭터 그리드가 나열된 전체 선택 화면으로, 시스템에 입력 가능한 대규모 후보군을 보여주는 스크린샷이다.
용어 해설
- 합성 데이터(Synthetic Data)
- — 실제 관측값 대신 알고리즘으로 생성한 레이블-데이터 쌍으로, 본문에서는 LLM이 원래 통계값을 보지 못한 상태에서 승패 라벨만 생성하도록 구성해 모델 편향을 줄이는 용도로 사용됐다. 이 방식은 원천 통계의 직접 노출 없이 결과 기반 학습을 가능하게 하며 교차 규칙 환경에서 사람의 휴리스틱을 학습하는 위험을 낮춘다.
- 데이터 누수(Data Leak)
- — 학습 데이터와 검증(또는 테스트) 데이터 사이에 동일하거나 강하게 상관된 정보가 포함되어 모델 성능이 부풀려지는 현상으로, 본문에서는 train/test 분할 검증 과정에서 동일 매치업이 양측에 중복되어 초기 정확도를 왜곡했다가 이를 제거하자 오히려 성능이 개선된 사례가 보고됐다.
- SHAP 값(SHAP values)
- — 개별 예측에 대한 각 피처의 기여도를 수치화한 값으로, 본문에서는 XGBoost의 특성 기여도를 SHAP로 계산한 뒤 이를 LLM에 입력해 수학적 근거 기반의 자연어 설명을 생성하는 데 활용했다. SHAP는 트리 기반 모델에서 피처 중요도를 로컬·글로벌 관점으로 해석할 수 있게 한다.
- LLM 기반 라벨링(LLM Labeling)
- — 거대한 언어 모델을 자동 라벨러로 활용해 원문 통계가 아닌 최소한의 식별자(캐릭터 이름·원칙)만 보고 승패를 판정하게 하는 방식으로, 이 절차는 인간 설계 휴리스틱을 배제하고 라벨 생성에서의 주관적 개입을 줄이는 목적이었다.
언급된 도구
부스팅 기반 분류기 구현 및 피처 중요도 학습
개별 예측에 대한 피처 기여도(로컬 설명) 계산
블라인드 라벨링과 SHAP 수치의 제약된 자연어 변환에 활용된 대규모 언어 모델
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
