본문으로 건너뛰기

1980년부터 2013년까지의 Usenet 아카이브를 포함한 1,030억 토큰 규모의 사전 학습 말뭉치 공개

1980~2013년 사이의 Usenet 게시물 4억 개를 가공하여 구축한 1,031억 토큰 규모의 고품질 사전 학습 데이터셋이 공개됐다.

실용적 조언

  • Hugging Face의 OwnedByDanes/Usenet-Corpus-1980-2013 저장소에서 데이터 카드와 샘플 데이터를 확인할 수 있다.
  • 특정 도메인이나 시대적 배경이 필요한 모델 파인튜닝 시 soc.culture.* 등 특정 뉴스그룹 계층을 선별하여 활용 가능하다.

섹션별 상세

01
작성자는 1980년부터 2013년까지의 Usenet 데이터를 수집하여 총 1,031억 개의 토큰(cl100k_base 기준)과 4억 800만 개의 게시물을 확보했다. 원시 MBOX 아카이브를 gzip으로 압축된 JSONL 형식으로 변환했으며, 18,347개의 뉴스그룹을 포함하는 방대한 규모를 자랑한다. 이는 상용 서비스나 소셜 미디어가 활성화되기 전의 순수한 인간 언어 진화 과정을 담고 있다는 점에서 희소성이 높다.
02
데이터 정제를 위해 이진 파일 제거, 중복 제거, 인용 텍스트 처리, 이메일 주소 비식별화 등 정교한 파이프라인을 구축했다. Meta의 fasttext LID-176 모델을 사용하여 모든 레코드의 언어를 감지했으며, 그 결과 데이터의 96.6%가 영어로 구성되어 있음을 확인했다. Message-ID를 SHA-256으로 해싱하여 개인정보를 보호하면서도 데이터의 무결성을 유지하도록 설계했다.
03
데이터셋의 시계열적 특성에 따르면 1986년 이전에는 데이터량이 적으나 90년대 초반부터 꾸준히 성장하여 1999~2000년 사이에 정점을 찍었다. 이후 포럼과 소셜 미디어의 등장으로 Usenet 이용이 감소하는 언어적·사회적 변화가 데이터에 그대로 반영되어 있다. 특히 SEO 최적화나 AI 생성 콘텐츠가 존재하지 않던 시절의 데이터라는 점이 모델 정렬 및 학습에 중요한 가치를 지닌다.

용어 해설

사전 학습 말뭉치(Pretraining Corpus)
AI 모델이 언어의 구조와 지식을 학습하기 위해 사용하는 대규모 텍스트 데이터 집합이다. 모델의 기초 지능과 언어 이해 능력을 결정하는 핵심 요소이다.
중복 제거(Deduplication)
데이터셋 내에서 동일하거나 매우 유사한 텍스트를 찾아 제거하는 과정이다. 모델이 특정 정보에 편향되거나 불필요한 연산을 반복하는 것을 방지하여 학습 효율을 높인다.
JSON 라인(JSONL)
각 행이 하나의 독립된 JSON 객체로 구성된 텍스트 파일 형식이다. 대규모 데이터셋을 한 줄씩 읽고 처리할 수 있어 메모리 효율적인 데이터 파이프라인 구축에 유리하다.
언어 식별 모델(LID-176)
텍스트가 어떤 언어로 작성되었는지 판별하는 모델로, Meta의 fasttext 라이브러리에서 176개 언어를 지원한다. 데이터셋의 언어별 구성을 파악하고 필터링하는 데 사용된다.

언급된 도구

fasttext추천

176개 언어 감지 및 텍스트 분류

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 02.수집 2026. 05. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.