본문으로 건너뛰기

서로 다른 규칙 체계의 대결을 예측하기 위해 XGBoost와 LLM 라벨러를 결합한 전체 스택 파이프라인 공개

XGBoost 분류기와 LLM 기반 블라인드 라벨러로 2,300개 이상의 이질적 규칙 대결을 학습시켜 SHAP 기반 설명을 더한 파이프라인이 깨끗한 홀드아웃에서 93% 정확도를 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

서로 다른 규칙 체계가 공존하는 이질적 도메인에서 인간 설계 휴리스틱이 모델에 그대로 반영되는 문제를 피하기 위해 작성자는 XGBoost 분류기와 LLM을 블라인드 라벨러로 결합한 파이프라인을 구현했다. LLM은 캐릭터 이름과 원칙 정보만 보고 2,300개가 넘는 매치업의 승패 라벨을 생성했고 XGBoost는 그 라벨로부터 자체적인 피처 가중치를 학습했다. 훈련/검증 분할에서 발견된 데이터 누수를 제거한 후 깨끗한 홀드아웃에서 93%의 정확도가 보고되었고, SHAP로 산출한 기여도를 제한된 제약과 함께 LLM에 입력해 수학적 근거 기반의 자연어 설명을 생성하는 계층을 더해 설명 가능성을 확보했다. 저장소와 라이브 데모가 공개되어 연구 재현과 추가 검증이 가능하며 LLM 라벨러의 잠재적 편향은 별도 검증이 필요한 한계로 남아 있다.

실용적 조언

  • 훈련 전 train/test 분할에서 매치업 식별자나 조합 키를 기준으로 중복 검사를 수행해야 한다. 동일 매치업이 양측 집합에 분산된 경우 데이터 누수로 이어질 수 있고 이는 성능 지표를 왜곡한다. 자동화된 중복 탐지 스크립트를 파이프라인 초기 단계에 배치하는 것이 안전하다.
  • 라벨을 외부 모델(예: LLM)로 생성할 때는 라벨의 생성 조건과 입력 제한을 명확히 기록해야 한다. 라벨러가 어떤 정보를 보았고 보지 않았는지 로그로 남겨라. 라벨 품질 평가는 인간 검증 표본과 통계적 일관성 검사로 병행해야 한다.
  • 해석 가능성을 위해 SHAP와 같은 수치적 기여도 산출 후 그 값을 제약된 자연어 생성 계층으로 변환하는 절차를 도입할 수 있다. 수치→제약된 템플릿→생성 모델 순서로 파이프라인을 구성하면 수학적 근거를 유지하면서 설명 가독성을 확보할 수 있다.

섹션별 상세

01
문제 배경은 서로 다른 규칙 체계가 공존하는 도메인에서 모델이 인간의 휴리스틱을 그대로 암기하는 것을 방지하는 것이었다. 이를 위해 작성자는 LLM을 라벨러로 사용해 2,300개가 넘는 교차 도메인 매치업에서 캐릭터 이름과 해당 규칙 집합만을 입력으로 하여 승패 라벨만 생성하게 했다. 이 방식은 통계적 스탯이나 규칙의 세부값을 LLM에게 노출하지 않았기에 라벨 생성 과정에서 작성자의 명시적 규칙 우선순위가 개입할 위험을 줄였다. 결과적으로 모델은 라벨로부터 자체적인 피처 가중치를 학습하도록 강제되었다.
02
데이터 파이프라인 검증 과정에서 발견된 핵심 문제는 훈련/검증 분할 단계의 은밀한 누수였다. 초기 측정값이 과도하게 높게 나와 파이프라인을 감수성 검사한 결과 동일 매치업이 양쪽 집합에 미러링되어 있었음이 확인되었다. 작성자는 누수를 제거하고 깨끗한 홀드아웃에서 재평가를 수행했고, 기대와 달리 성능은 더 상승하여 최종적으로 93% 정확도가 보고됐다. 이 사례는 표면적 높은 정확도가 항상 일반화 성능을 보장하지 않음을 수치로 강조했다.
03
모델 선택과 학습 접근은 XGBoost를 중심으로 이루어졌고, XGBoost는 라벨(승패)을 목표로 피처 중요도를 학습하는 부스팅 트리 앙상블로 동작했다. 작성자는 LLM이 생성한 라벨과 원시 입력 특성들을 XGBoost에 공급해 모델이 휴리스틱 대신 통계적 상관관계를 포착하도록 설계했다. 학습 결과는 모델이 특정 환경 특성에 맞춘 가중치를 형성했음을 시사했고 이는 SHAP 기반으로 분석 가능한 형태로 남겼다. 이 절차는 규칙이 상충하는 상황에서 단일 휴리스틱에 의존하지 않는 예측을 산출하는 데 기여했다.
04
해석 가능성 확보는 SHAP 값 계산과 그 값을 자연어로 변환하는 생성 계층의 결합으로 해결됐다. 먼저 XGBoost의 각 예측에 대해 SHAP로 로컬 기여도를 산출하고, 이후 엄격한 도메인 제약을 부여한 LLM에 이 수치들을 입력해 수학적으로 근거 있는 설명을 생성하게 했다. 이 파이프라인은 단순한 승패 출력뿐 아니라 어떤 피처들이 얼마나 기여했는지를 논리적 근거와 함께 제공했고, 작성자는 이 과정이 구조적 환상(무근거 추론)을 줄이는 방향으로 작동했다고 보고했다.
05
시스템은 전체 스택으로 배포되었고 코드와 데모가 공개되어 재현 가능성이 확보됐다. GitHub 저장소와 라이브 엔드포인트가 제공되어 파이프라인 구성 요소와 결과를 직접 조회할 수 있도록 했다. 공개 배포는 모델 구성, 데이터 생성 방식, 설명 생성 루틴을 실제로 확인하고 재평가할 수 있는 근거를 제공했다. 따라서 실무 적용을 위한 출발점과 검증 가능한 참고 자료가 동시에 제공된 형태다.

이미지 분석

선택 화면과 캐릭터 카드가 나열된 애플리케이션 UI 스크린샷으로, 모델이 예측 대상으로 삼는 다양한 엔티티와 원천 규칙 세트를 보여준다.
Screenshot

이 이미지는 파이프라인 입력 분포를 시각적으로 확인할 수 있게 하며 여러 캐릭터와 규칙 세트가 어떻게 정렬되어 있는지 보여준다. 다양한 원천 규칙과 캐릭터 조합이 후보군으로 존재함을 통해 합성 라벨링과 학습 데이터의 이질성이 확보되었음을 추정할 수 있다. 입력 다양성은 모델 일반화 평가에 중요한 전제 조건으로 작용한다.

선택 화면과 캐릭터 카드가 나열된 애플리케이션 UI 스크린샷으로, 모델이 예측 대상으로 삼는 다양한 엔티티와 원천 규칙 세트를 보여준다.

배틀 분석 텍스트와 승자, 신뢰도 수치(예: Satoru Gojo 승리 75.4%) 및 결정 요인 목록을 포함한 결과 화면 스크린샷이다.
Screenshot

이 화면은 파이프라인의 출력 구성요소를 직접 보여주며 최종 승자와 신뢰도 수치가 명시되어 있다. 결정 요인 섹션에는 속도·시간·내구성 등 개별 기여 항목과 정량적 기여치가 나열되어 있어 SHAP와 유사한 기여도 기반의 결정을 시각적으로 확인할 수 있다. 따라서 이 이미지는 모델의 예측 결과와 설명 가능성 구현의 산출물을 동시에 보여주는 증거 역할을 한다.

배틀 분석 텍스트와 승자, 신뢰도 수치(예: Satoru Gojo 승리 75.4%) 및 결정 요인 목록을 포함한 결과 화면 스크린샷이다.

좌우 두 플레이어의 캐릭터 그리드가 나열된 전체 선택 화면으로, 시스템에 입력 가능한 대규모 후보군을 보여주는 스크린샷이다.
Screenshot

이 이미지는 입력 공간의 크기와 다양성을 시각적으로 보여줘 합성 라벨링 과정에서 LLM이 처리해야 하는 조합 수의 규모를 가늠하게 한다. 후보군의 다양성은 모델이 특정 규칙군에 과도하게 적합되는 것을 방지하는 데 필요한 데이터 분포의 폭을 제공한다. 따라서 이미지 전체는 파이프라인의 문제 설정과 데이터 생성 의도를 보완하는 근거로 작용한다.

좌우 두 플레이어의 캐릭터 그리드가 나열된 전체 선택 화면으로, 시스템에 입력 가능한 대규모 후보군을 보여주는 스크린샷이다.

용어 해설

합성 데이터(Synthetic Data)
실제 관측값 대신 알고리즘으로 생성한 레이블-데이터 쌍으로, 본문에서는 LLM이 원래 통계값을 보지 못한 상태에서 승패 라벨만 생성하도록 구성해 모델 편향을 줄이는 용도로 사용됐다. 이 방식은 원천 통계의 직접 노출 없이 결과 기반 학습을 가능하게 하며 교차 규칙 환경에서 사람의 휴리스틱을 학습하는 위험을 낮춘다.
데이터 누수(Data Leak)
학습 데이터와 검증(또는 테스트) 데이터 사이에 동일하거나 강하게 상관된 정보가 포함되어 모델 성능이 부풀려지는 현상으로, 본문에서는 train/test 분할 검증 과정에서 동일 매치업이 양측에 중복되어 초기 정확도를 왜곡했다가 이를 제거하자 오히려 성능이 개선된 사례가 보고됐다.
SHAP 값(SHAP values)
개별 예측에 대한 각 피처의 기여도를 수치화한 값으로, 본문에서는 XGBoost의 특성 기여도를 SHAP로 계산한 뒤 이를 LLM에 입력해 수학적 근거 기반의 자연어 설명을 생성하는 데 활용했다. SHAP는 트리 기반 모델에서 피처 중요도를 로컬·글로벌 관점으로 해석할 수 있게 한다.
LLM 기반 라벨링(LLM Labeling)
거대한 언어 모델을 자동 라벨러로 활용해 원문 통계가 아닌 최소한의 식별자(캐릭터 이름·원칙)만 보고 승패를 판정하게 하는 방식으로, 이 절차는 인간 설계 휴리스틱을 배제하고 라벨 생성에서의 주관적 개입을 줄이는 목적이었다.

언급된 도구

XGBoost추천

부스팅 기반 분류기 구현 및 피처 중요도 학습

SHAP추천

개별 예측에 대한 피처 기여도(로컬 설명) 계산

LLM (라벨러·생성 보조)중립

블라인드 라벨링과 SHAP 수치의 제약된 자연어 변환에 활용된 대규모 언어 모델

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 16.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.