distilbert/distilbert-base-uncased
BERT base를 지식 증류해 작고 빠르게 만든 uncased 영어 Fill-mask 모델
학습 방식 · BERT base model을 teacher로 사용해 BookCorpus와 English Wikipedia에서 distillation loss, masked language modeling, cosine embedding loss를 결합한 자기지도 사전학습을 수행했습니다.
TL;DR
DistilBERT는 BERT base model을 teacher로 삼아 지식 증류한 uncased 영어 Transformer 모델로, 원본보다 작은 크기와 빠른 추론을 목표로 합니다. 사전학습 과정에서 teacher의 확률 분포를 따르는 distillation loss, 입력 토큰의 15%를 가리고 복원하는 masked language modeling, teacher와 가까운 hidden state를 만드는 cosine embedding loss를 함께 사용했습니다. [MASK] 위치의 단어 예측과 문장 전체를 활용하는 sequence classification, token classification, question answering의 기반 모델로 쓰이며, 텍스트 생성에는 적합하지 않습니다. BookCorpus와 English Wikipedia로 학습했고, Fine-tuning 후 GLUE에서 MNLI 82.2, QQP 88.5, QNLI 89.2, SST-2 91.3을 기록했습니다.
핵심 포인트
- BERT base model의 출력 확률과 hidden state를 함께 모방해 원본의 언어 표현을 작은 모델에 전달합니다.
- 입력 토큰 15%를 마스킹하고 양방향 문맥으로 복원해 [MASK] 위치의 단어를 예측합니다.
- WordPiece와 30,000개 vocabulary로 텍스트를 소문자화해 처리하며 입력 길이는 512 tokens 미만입니다.
- Downstream Fine-tuning 후 GLUE에서 SST-2 91.3, QNLI 89.2 등 태스크별 점수를 기록했습니다.
제한사항
- 학습 데이터와 teacher model에서 비롯한 편향이 masked token 예측에 나타나며 Fine-tuned 버전에도 영향을 줍니다.
- 주요 용도는 문장 전체를 활용하는 분류·토큰 분류·질의응답이며, text generation에는 적합하지 않습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MNLI | GLUE test score | 82.2 | — |
| QQP | GLUE test score | 88.5 | — |
| QNLI | GLUE test score | 89.2 | — |
| SST-2 | GLUE test score | 91.3 | — |
| CoLA | GLUE test score | 51.3 | — |
| STS-B | GLUE test score | 85.8 | — |
| MRPC | GLUE test score | 87.5 | — |
| RTE | GLUE test score | 59.9 | — |
1k
LIKES
7M
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.