프리트레이닝 데이터 소스
프리트레이닝 데이터 소스는 모델 초기 언어 학습에 사용되는 대용량 텍스트와 코드 출처를 가리키며, 기사에서는 Wikipedia, Wikibooks, Common Crawl, arXiv, GitHub, FineMath 3, Dolma 코퍼스의 Reddit·Semantic Scholar·Project Gutenberg 항목이 열거되었다. 데이터 소스는 입력(원자료)→처리(정제·필터링·라벨링)→출력(학습 코퍼스)의 흐름으로 활용되며, 각 소스의 라이선스와 생성 방식이 개방성 판단의 핵심 증거로 작용한다고 설명됐다. 출처별 공개 여부와 생성에 사용된 도구가 오픈 모델 구축의 재현성과 법적 해석에 직접적 영향을 미친다고 보였다.