TL;DR
이 글은 공개 코퍼스 기반 모델을 목표로 한 프로젝트가 실제로는 폐쇄형 LLM의 산출물을 학습 파이프라인에 포함시키는 관행과 마주하고 있음을 지적했다. 입력은 Wikipedia·Common Crawl·arXiv·GitHub 등 다양한 공개소스와 FineMath 3 같은 수학 데이터였고 처리 과정에서 Llama·Qwen·GPT4 산출물이 후속 데이터로 통합되었으며 출력은 공개 가능한 학습 코퍼스였다는 점이 근거로 제시되었다. 법적 판단의 불확실성과 Distillation의 경계 모호성이 공개성 재현성을 제한한다고 결론지었다.
섹션별 상세
- Olmo는 Wikipedia·Wikibooks·Common Crawl·arXiv LaTeX 논문·GitHub 코드·FineMath 3 등 다양한 공개 소스를 사전학습에 사용했다는 주장이다. — Olmo 모델 보고서의 데이터 소스 목록 항목을 확인하면 Wikipedia, Wikibooks, Common Crawl, arXiv LaTeX 논문, GitHub 코드, FineMath 3가 명시되어 있음.
- FineMath 3의 일부는 Llama의 주석 산출을 사용해 생성되었다는 주장이다. — 원문에서 FineMath 3가 Llama LLM의 어노테이션으로 생성되었다는 기술적 진술이 존재함.
- Olmo 파이프라인의 수학 데이터 일부는 Qwen으로 생성되었고 복잡한 추론에는 GPT4의 thinking traces를 사용했다는 주장이다. — 원문 기술에 Qwen과 GPT4가 후속 데이터 생성과 복잡한 추론 산출물 확보에 사용되었다는 구체적 서술이 포함됨.
- 책을 구매해 스캔하고 OCR로 변환하면 학습 코퍼스에 추가하는 행위가 '공정 사용'으로 간주된다는 것이 법적 예시라는 주장이다. — 원문은 물리적 책을 스캔·OCR하여 코퍼스에 추가하는 사례를 들어 법적 판단이 혼란스럽다고 지적함.
용어 해설
- Olmo
- — Olmo는 Ai2에서 공개한 코퍼스 모델 사례로, Wikipedia·Wikibooks·Common Crawl에서 추출한 웹페이지·arXiv LaTeX 논문·GitHub 코드·FineMath 3 기반 수학 웹페이지 등 다양한 소스를 사전학습 데이터로 사용한 것으로 보고되었다. 보고서는 사용한 데이터 항목을 목록화했고, 이 목록을 바탕으로 공개성의 범위를 주장하는 근거로 활용되었다. Olmo의 데이터 파이프라인에는 외부 LLM 산출물이 일부 후속 데이터로 포함된 점이 핵심 쟁점으로 제기되었다.
- Distillation
- — Distillation은 한 언어모델의 텍스트 출력을 다른 모델의 학습셋으로 수집하여 재학습시키는 관행을 가리킨다. 입력은 선행 모델의 출력 텍스트이고 처리 과정은 수집·정제·통합·재학습이며 산출은 대상 모델의 학습 데이터가 되는 방식으로 작동한다. 이 글에서는 Distillation의 경계가 라이선스와 공개성 판단에서 불명확하다고 지적되었다.
- FineMath 3
- — FineMath 3는 수학 관련 웹페이지와 생성된 수학 데이터가 혼재된 데이터셋으로, 해당 버전의 일부 항목은 Llama LLM의 주석 산출을 이용해 생성된 것으로 보고되었다. 데이터셋은 수학 문제와 해설을 포함하는 페이지들을 모아 구성되었고, Olmo 사전학습 데이터의 일부로 사용된 것으로 나타났다. FineMath 3의 생성 과정에서 사용된 소스와 생성 모델의 공개 여부가 개방성 논쟁의 핵심 근거로 부각되었다.
기술
- Olmo
- FineMath 3
- Llama
- Qwen
- GPT4
- Common Crawl
- arXiv
- GitHub
- Wikipedia
- Wikibooks
- Project Gutenberg
- Semantic Scholar
- Dolma corpus
활용 사례
- open-corpus pretraining을 위한 다양한 공개 데이터 통합
- LLM 산출물을 활용한 수학 데이터셋 생성
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.