openai-community/gpt2
영어 텍스트 생성 및 downstream task Fine-tuning124M1K 컨텍스트MIT
124M 파라미터 GPT-2 영어 causal language model
학습 방식 · WebText 영어 웹 문서를 활용한 self-supervised causal language modeling 사전학습으로, 입력 토큰열을 한 칸 이동한 정답과 비교해 다음 토큰 예측 능력을 학습했습니다.
TL;DR
GPT-2는 다른 모델을 덧붙인 파생형이 아닌 124M 파라미터 규모의 영어 causal language modeling 기반 모델입니다. 입력 토큰열에서 미래 토큰을 가리는 mask를 적용하고, 한 칸 오른쪽으로 이동한 동일한 토큰열을 정답으로 삼아 다음 토큰을 예측합니다. byte-level BPE와 50,257개 어휘, 최대 1,024개 연속 토큰 입력을 사용하며 prompt 기반 영어 텍스트 생성과 Fine-tuning의 출발점으로 활용됩니다. WebText의 비공개·비정제 웹 데이터에서 학습해 사실성 보장과 편향 대응이 필요한 용도에는 별도 검증이 필요합니다.
핵심 포인트
- 미래 토큰을 가리는 causal mask로 앞선 문맥만 사용해 다음 토큰을 예측합니다.
- byte-level BPE와 50,257개 어휘, 1,024개 토큰 입력으로 영어 문맥을 처리합니다.
- WebText에서 비지도 방식으로 학습했으며 원본 학습 데이터는 공개되지 않았습니다.
- zero-shot 평가에서 LAMBADA PPL 35.13, WikiText2 PPL 29.41을 기록했습니다.
제한사항
- WebText는 Reddit outbound link 기반으로 수집한 비정제 웹 문서 40GB 규모이며 데이터셋 자체는 공개되지 않았습니다.
- 모델은 사실과 허구를 구분하지 않으므로 생성 결과의 사실성이 필요한 용도에 적합하지 않습니다.
- 학습 데이터의 편향이 생성 결과에 반영될 수 있어 인간 속성과 관련된 민감한 용도에는 편향 검증이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| LAMBADA | PPL | 35.13 | — |
| LAMBADA | ACC | 45.99 | — |
| CBT-CN | ACC | 87.65 | — |
| CBT-NE | ACC | 83.4 | — |
| WikiText2 | PPL | 29.41 | — |
| PTB | PPL | 65.85 | — |
| enwiki8 | BPB | 1.16 | — |
| text8 | BPC | 1,17 | — |
| WikiText103 | PPL | 37.50 | — |
| 1BW | PPL | 75.20 | — |
3.5k
LIKES
14.5M
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.