본문으로 건너뛰기

CausalMix: 언어 모델 학습을 위한 데이터 혼합을 인과추론 관점으로 재정의

대규모 언어모델의 성능은 훈련 데이터의 도메인 비중에 민감하며, 기존 방법은 고정된 데이터 분포 가정 때문에 데이터 풀이나 모델 규모가 바뀔 때마다 비용 높은 재탐색이 필요했다. 본 논문은 데이터 혼합 문제를 상태조건화된 인과추정 문제로 바꾸어 프록시 실행으로부터 국소적 인과적 주변 이득을 산출한다. 이 접근은 혼합 정책의 해석성과 전이성을 제공해 적은 수의 프록시로도 대규모 데이터풀과 큰 모델로 확장할 수 있는 근거를 마련한다.

용어 해설

조건부 평균 처치효과(Conditional Average Treatment Effect)
주어진 데이터 상태 X에 조건화했을 때 특정 도메인 비중 변화가 downstream 성능 Y에 미치는 국소적 인과적 단기 이득을 수치로 나타낸 개념이다. 본 논문에서는 연속적 혼합비용 표현 Z=log(T+ε)에 대해 부분선형 근사를 사용해 θ0(X)로 표현하며, θ0,k(X)>0이면 해당 도메인의 비중을 늘리는 것이 성능 향상으로 이어짐을 의미한다.
이중 머신러닝(Double Machine Learning)
공변량 X에 대해 결과 Y와 처치 Z를 각각 예측해 잔차를 만든 뒤 잔차 간 관계를 추정해 인과효과를 얻는 절차이다. 본 논문에서는 m0(X)=E[Y|X], e0(X)=E[Z|X]를 추정하고 Ỹ=Y−m0(X), Z̃=Z−e0(X)를 통해 θ0(X)을 회귀로 추정하는 방식으로 사용되었다.
로그 혼합 표현(Log-Mixture Representation)
혼합벡터 T의 각 성분에 작은 상수 ε를 더한 뒤 원소별 로그를 취한 Z=log(T+ε) 표현으로, 조성 데이터의 기하학적 특성을 보정하고 부분선형 모델에서 선형 항으로 사용된다. 이 표현은 혼합비의 비율적 변화가 성능에 미치는 영향을 선형 근사로 모델링할 때 유리하다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.