본문으로 건너뛰기

Pretraining Data Filtering

사전학습 데이터 필터링

모델을 학습시키기 전에 특정 기준에 맞지 않는 문서와 개념을 제거하는 과정입니다. LittleLearner는 미국 초등학교 K–5 교육과정에 맞춰 880억 토큰을 선별해 학습 범위를 통제하고, 지식 습득과 단순한 지식 유도를 구분하는 실험 조건을 만듭니다.