본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

openai-community/gpt2

영어 텍스트 생성 및 downstream task Fine-tuning124M1K 컨텍스트MIT

124M 파라미터 GPT-2 영어 causal language model

학습 방식 · WebText 영어 웹 문서를 활용한 self-supervised causal language modeling 사전학습으로, 입력 토큰열을 한 칸 이동한 정답과 비교해 다음 토큰 예측 능력을 학습했습니다.

TL;DR

GPT-2는 다른 모델을 덧붙인 파생형이 아닌 124M 파라미터 규모의 영어 causal language modeling 기반 모델입니다. 입력 토큰열에서 미래 토큰을 가리는 mask를 적용하고, 한 칸 오른쪽으로 이동한 동일한 토큰열을 정답으로 삼아 다음 토큰을 예측합니다. byte-level BPE와 50,257개 어휘, 최대 1,024개 연속 토큰 입력을 사용하며 prompt 기반 영어 텍스트 생성과 Fine-tuning의 출발점으로 활용됩니다. WebText의 비공개·비정제 웹 데이터에서 학습해 사실성 보장과 편향 대응이 필요한 용도에는 별도 검증이 필요합니다.

핵심 포인트

  • 미래 토큰을 가리는 causal mask로 앞선 문맥만 사용해 다음 토큰을 예측합니다.
  • byte-level BPE와 50,257개 어휘, 1,024개 토큰 입력으로 영어 문맥을 처리합니다.
  • WebText에서 비지도 방식으로 학습했으며 원본 학습 데이터는 공개되지 않았습니다.
  • zero-shot 평가에서 LAMBADA PPL 35.13, WikiText2 PPL 29.41을 기록했습니다.

제한사항

  • WebText는 Reddit outbound link 기반으로 수집한 비정제 웹 문서 40GB 규모이며 데이터셋 자체는 공개되지 않았습니다.
  • 모델은 사실과 허구를 구분하지 않으므로 생성 결과의 사실성이 필요한 용도에 적합하지 않습니다.
  • 학습 데이터의 편향이 생성 결과에 반영될 수 있어 인간 속성과 관련된 민감한 용도에는 편향 검증이 필요합니다.

벤치마크

벤치마크지표비교
LAMBADAPPL35.13
LAMBADAACC45.99
CBT-CNACC87.65
CBT-NEACC83.4
WikiText2PPL29.41
PTBPPL65.85
enwiki8BPB1.16
text8BPC1,17
WikiText103PPL37.50
1BWPPL75.20

3.5k

LIKES

14.5M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.