본문으로 건너뛰기

Pre-training data filtering

사전학습 데이터 필터링

훈련에 투입되는 대규모 코퍼스에서 유해하거나 오용 가능성이 큰 정보를 사전에 제거한 뒤 모델을 학습시키는 방법이다. 연구에서는 특정 생물학적 지식의 유출을 낮추면서 전체 성능을 유지하는 사례가 보고되지만, 코딩·사이버역량을 분리하기 어렵다는 한계가 있다.