본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

distilbert/distilbert-base-uncased

Masked language modeling과 문장·토큰 분류, 질의응답을 위한 영어 텍스트 표현 학습512K 컨텍스트apache-2.0

BERT base를 지식 증류해 작고 빠르게 만든 uncased 영어 Fill-mask 모델

학습 방식 · BERT base model을 teacher로 사용해 BookCorpus와 English Wikipedia에서 distillation loss, masked language modeling, cosine embedding loss를 결합한 자기지도 사전학습을 수행했습니다.

TL;DR

DistilBERT는 BERT base model을 teacher로 삼아 지식 증류한 uncased 영어 Transformer 모델로, 원본보다 작은 크기와 빠른 추론을 목표로 합니다. 사전학습 과정에서 teacher의 확률 분포를 따르는 distillation loss, 입력 토큰의 15%를 가리고 복원하는 masked language modeling, teacher와 가까운 hidden state를 만드는 cosine embedding loss를 함께 사용했습니다. [MASK] 위치의 단어 예측과 문장 전체를 활용하는 sequence classification, token classification, question answering의 기반 모델로 쓰이며, 텍스트 생성에는 적합하지 않습니다. BookCorpus와 English Wikipedia로 학습했고, Fine-tuning 후 GLUE에서 MNLI 82.2, QQP 88.5, QNLI 89.2, SST-2 91.3을 기록했습니다.

핵심 포인트

  • BERT base model의 출력 확률과 hidden state를 함께 모방해 원본의 언어 표현을 작은 모델에 전달합니다.
  • 입력 토큰 15%를 마스킹하고 양방향 문맥으로 복원해 [MASK] 위치의 단어를 예측합니다.
  • WordPiece와 30,000개 vocabulary로 텍스트를 소문자화해 처리하며 입력 길이는 512 tokens 미만입니다.
  • Downstream Fine-tuning 후 GLUE에서 SST-2 91.3, QNLI 89.2 등 태스크별 점수를 기록했습니다.

제한사항

  • 학습 데이터와 teacher model에서 비롯한 편향이 masked token 예측에 나타나며 Fine-tuned 버전에도 영향을 줍니다.
  • 주요 용도는 문장 전체를 활용하는 분류·토큰 분류·질의응답이며, text generation에는 적합하지 않습니다.

벤치마크

벤치마크지표비교
MNLIGLUE test score82.2
QQPGLUE test score88.5
QNLIGLUE test score89.2
SST-2GLUE test score91.3
CoLAGLUE test score51.3
STS-BGLUE test score85.8
MRPCGLUE test score87.5
RTEGLUE test score59.9

1k

LIKES

7M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.