Pretraining Data Filtering
사전학습 데이터 필터링
모델을 학습시키기 전에 특정 기준에 맞지 않는 문서와 개념을 제거하는 과정입니다. LittleLearner는 미국 초등학교 K–5 교육과정에 맞춰 880억 토큰을 선별해 학습 범위를 통제하고, 지식 습득과 단순한 지식 유도를 구분하는 실험 조건을 만듭니다.
사전학습 데이터 필터링
모델을 학습시키기 전에 특정 기준에 맞지 않는 문서와 개념을 제거하는 과정입니다. LittleLearner는 미국 초등학교 K–5 교육과정에 맞춰 880억 토큰을 선별해 학습 범위를 통제하고, 지식 습득과 단순한 지식 유도를 구분하는 실험 조건을 만듭니다.