본문으로 건너뛰기

표 형식 파운데이션 모델을 위한 사전 분포 정렬 기반 데이터 클리닝

표 형식 파운데이션 모델(TFM)은 적은 데이터로도 강력한 성능을 내지만, 입력 데이터에 결측치나 이상치가 있으면 성능이 급격히 저하된다. 이 논문은 강화학습을 통해 데이터 클리닝 순서를 최적화하여 모델이 학습한 가상 분포와 실제 데이터를 일치시킴으로써 정확도를 높이고 모델의 확신 편향 문제를 해결한다.

용어 해설

표 형식 파운데이션 모델(Tabular Foundation Model)
대규모 합성 데이터나 다양한 데이터셋에서 사전 학습되어, 별도의 추가 학습 없이도 새로운 표 형식 데이터에 대해 즉각적인 예측을 수행할 수 있는 AI 모델이다. 적은 양의 데이터로도 높은 성능을 내지만 입력 데이터의 분포 변화에 민감하다는 특징이 있다.
사전 분포 정렬(Prior Alignment)
실제 입력 데이터의 통계적 분포를 모델이 학습 시 가정했던 가상의 데이터 분포(Prior)와 일치시키는 과정이다. 데이터 클리닝을 통해 이 간극을 줄임으로써 모델의 예측 정확도와 신뢰도를 동시에 회복하는 것이 목적이다.
인컨텍스트 러닝(In-Context Learning)
모델의 가중치를 업데이트하지 않고 입력 프롬프트에 포함된 예시 데이터만을 활용하여 새로운 작업을 수행하는 방식이다. 표 형식 모델에서는 입력된 행 데이터들이 모델의 예측을 위한 문맥(Context) 역할을 수행한다.
기대 보정 오차(Expected Calibration Error)
모델이 예측한 확률(신뢰도)과 실제 정확도 사이의 차이를 측정하는 지표이다. 이 수치가 낮을수록 모델이 자신의 예측이 맞을 확률을 더 정확하게 판단하고 있음을 의미하며, 고위험 의사결정 분야에서 매우 중요하다.

코드 예제

python
class DataQualityObserver:
    def compute_state(self, dataset):
        # 9-dimensional state vector
        r_miss = mean_missing_rate(dataset)
        w1 = mean_wasserstein_drift(dataset)
        skew = mean_absolute_skewness(dataset)
        kurt = mean_absolute_kurtosis(dataset)
        delta_bal = class_balance_ratio(dataset)
        r_ret = row_retention_ratio(dataset)
        # action history flags
        h_imp, h_out, h_scl = self.get_action_history()
        return [r_miss, w1, skew, kurt, delta_bal, r_ret, h_imp, h_out, h_scl]

데이터셋의 품질 상태를 9차원 벡터로 변환하여 RL 에이전트의 관측값으로 제공하는 로직

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 28.수집 2026. 05. 06.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.