google-bert/bert-base-uncased
Masked Language Modeling, 문장 표현 추출 및 downstream Fine-tuning110M512K 컨텍스트apache-2.0
영어 문장을 양방향으로 처리해 가린 단어를 예측하는 BERT 기반 모델
학습 방식 · BookCorpus와 English Wikipedia의 비라벨 텍스트를 소문자화·WordPiece 토큰화한 뒤, Masked Language Modeling과 Next Sentence Prediction을 Adam으로 1,000,000단계 사전학습했다.
TL;DR
BERT base model (uncased)는 영어 문장을 양방향으로 읽는 110M 파라미터 기반 모델로, 직접적인 생성보다 Masked Language Modeling과 downstream Fine-tuning에 맞춰졌다. 입력 텍스트를 소문자화하고 30,000개 WordPiece vocabulary로 토큰화한 뒤, 최대 512토큰의 [CLS] Sentence A [SEP] Sentence B [SEP] 형식으로 처리한다. 사전학습에서는 토큰 15%를 가리고 원래 단어를 예측하며, 문장 쌍의 연속 여부도 함께 학습해 문장 전체의 표현을 만든다. Sequence classification, token classification, question answering의 출발점으로 활용할 수 있지만, 영어 데이터와 학습 코퍼스에서 비롯된 편향이 downstream 버전에도 이어질 수 있다.
핵심 포인트
- RNN처럼 토큰을 순서대로만 읽지 않고 문장 양쪽의 문맥을 함께 사용해 가린 단어를 예측하므로 문장 전체 표현을 downstream 태스크에 재사용할 수 있다.
- BookCorpus와 English Wikipedia로 사전학습했으며 15% 토큰 마스킹과 Next Sentence Prediction을 결합해 영어 문장 관계와 어휘 문맥을 학습했다.
- 소문자화와 30,000개 WordPiece vocabulary를 적용하고 입력 길이를 최대 512토큰으로 제한해 영어 텍스트 분류와 질의응답의 기반으로 쓰기 좋다.
- GLUE Fine-tuning 결과 평균 79.6을 기록했지만, man과 woman 문장 예시에서 직업 예측 분포가 다르게 나타나 편향 점검이 필요하다.
제한사항
- 학습 데이터가 English BookCorpus와 English Wikipedia에 한정되어 영어 외 언어와 다른 도메인에서는 성능을 별도로 확인해야 한다.
- Masked Language Modeling 예시에서 성별에 따른 직업 예측 차이가 나타나며, 이 편향이 Fine-tuned 버전에도 영향을 줄 수 있다.
- 텍스트 생성보다는 문장 전체를 활용하는 sequence classification, token classification, question answering에 맞춰진 구조다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GLUE MNLI-m | score | 84.6 | — |
| GLUE MNLI-mm | score | 83.4 | — |
| GLUE QQP | score | 71.2 | — |
| GLUE QNLI | score | 90.5 | — |
| GLUE SST-2 | score | 93.5 | — |
| GLUE CoLA | score | 52.1 | — |
| GLUE STS-B | score | 85.8 | — |
| GLUE MRPC | score | 88.9 | — |
| GLUE RTE | score | 66.4 | — |
| GLUE Average | score | 79.6 | — |
2.8k
LIKES
69.7M
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.