본문으로 건너뛰기

Masked Language Modeling

마스크 언어 모델링

문장 일부를 [MASK]로 가린 뒤 양쪽 문맥을 사용해 원래 토큰을 예측하도록 학습하는 목표입니다. BERT는 주로 약 15%의 고정된 마스킹 비율을 사용하지만, masked diffusion은 0%에서 100% 사이의 다양한 마스킹 수준을 학습합니다. 이 확장을 통해 빈칸 채우기 중심의 표현 학습 목표가 생성 모델의 학습 목표로 바뀝니다.