본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

google-bert/bert-base-uncased

Masked Language Modeling, 문장 표현 추출 및 downstream Fine-tuning110M512K 컨텍스트apache-2.0

영어 문장을 양방향으로 처리해 가린 단어를 예측하는 BERT 기반 모델

학습 방식 · BookCorpus와 English Wikipedia의 비라벨 텍스트를 소문자화·WordPiece 토큰화한 뒤, Masked Language Modeling과 Next Sentence Prediction을 Adam으로 1,000,000단계 사전학습했다.

TL;DR

BERT base model (uncased)는 영어 문장을 양방향으로 읽는 110M 파라미터 기반 모델로, 직접적인 생성보다 Masked Language Modeling과 downstream Fine-tuning에 맞춰졌다. 입력 텍스트를 소문자화하고 30,000개 WordPiece vocabulary로 토큰화한 뒤, 최대 512토큰의 [CLS] Sentence A [SEP] Sentence B [SEP] 형식으로 처리한다. 사전학습에서는 토큰 15%를 가리고 원래 단어를 예측하며, 문장 쌍의 연속 여부도 함께 학습해 문장 전체의 표현을 만든다. Sequence classification, token classification, question answering의 출발점으로 활용할 수 있지만, 영어 데이터와 학습 코퍼스에서 비롯된 편향이 downstream 버전에도 이어질 수 있다.

핵심 포인트

  • RNN처럼 토큰을 순서대로만 읽지 않고 문장 양쪽의 문맥을 함께 사용해 가린 단어를 예측하므로 문장 전체 표현을 downstream 태스크에 재사용할 수 있다.
  • BookCorpus와 English Wikipedia로 사전학습했으며 15% 토큰 마스킹과 Next Sentence Prediction을 결합해 영어 문장 관계와 어휘 문맥을 학습했다.
  • 소문자화와 30,000개 WordPiece vocabulary를 적용하고 입력 길이를 최대 512토큰으로 제한해 영어 텍스트 분류와 질의응답의 기반으로 쓰기 좋다.
  • GLUE Fine-tuning 결과 평균 79.6을 기록했지만, man과 woman 문장 예시에서 직업 예측 분포가 다르게 나타나 편향 점검이 필요하다.

제한사항

  • 학습 데이터가 English BookCorpus와 English Wikipedia에 한정되어 영어 외 언어와 다른 도메인에서는 성능을 별도로 확인해야 한다.
  • Masked Language Modeling 예시에서 성별에 따른 직업 예측 차이가 나타나며, 이 편향이 Fine-tuned 버전에도 영향을 줄 수 있다.
  • 텍스트 생성보다는 문장 전체를 활용하는 sequence classification, token classification, question answering에 맞춰진 구조다.

벤치마크

벤치마크지표비교
GLUE MNLI-mscore84.6
GLUE MNLI-mmscore83.4
GLUE QQPscore71.2
GLUE QNLIscore90.5
GLUE SST-2score93.5
GLUE CoLAscore52.1
GLUE STS-Bscore85.8
GLUE MRPCscore88.9
GLUE RTEscore66.4
GLUE Averagescore79.6

2.8k

LIKES

69.7M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.