섹션별 상세
1900년 이전의 도서, 신문 등에서 추출한 220억 토큰의 데이터를 OCR 점수 및 키워드 필터링을 통해 엄격하게 정제했다. 아인슈타인이나 양자 역학 등 사후 지식의 유출을 막기 위해 'Einstein' 등의 단어가 포함된 문서는 모두 폐기하는 공격적인 필터링 전략을 사용했다. 이를 통해 현대 물리학의 결론을 미리 알지 못하는 순수한 19세기 지식 베이스를 구축했다.
근거
- 1900년 이전 데이터셋은 필터링 후 약 220억 토큰의 클린 텍스트로 구성되었다. — Data Collection and Curation 섹션 마지막 문단
3.3B 파라미터 규모의 트랜스포머 모델을 Muon 옵티마이저를 사용하여 학습시켰으며, 이는 데이터 제약 환경에서 효율적인 스케일링을 위함이다. 친칠라 최적 비율보다 낮은 11:1의 데이터 대 파라미터 비율을 선택하여 학습을 진행했다. 결과적으로 모델은 GPT-2보다는 낮은 성능을 보였는데, 이는 역사적 데이터의 OCR 품질 저하와 언어적 특성 차이에 기인한 것으로 분석된다.
python
import torch
# ... (nanochat fork logic)
# Muon optimizer implementation for better scaling
# D:P ratio 11:1 for 3.3B model training안드레 카파시의 nanochat을 포크하여 3.3B 파라미터 모델을 학습시키는 구성 예시
근거
- 학습된 3.3B 모델은 D:P 비율 11:1에서 약 5.5e20 FLOPs의 연산량을 사용했다. — Pretraining 섹션의 모델 사양 설명
물리학적 추론 능력을 극대화하기 위해 뉴턴, 맥스웰, 패러데이 등의 고전 물리 저작 2.9억 토큰을 추가로 학습(Midtraining)시켰다. 이후 현대 LLM을 사용하여 1900년 이전 문헌에서 추출한 통찰을 바탕으로 지시어 쌍을 생성하여 SFT를 진행했다. 마지막으로 REINFORCE 알고리즘과 LLM 판별자를 활용한 RL 과정을 통해 물리적 모순을 해결하는 논리적 구조를 강화했다.

광전 효과와 흑체 복사 등 현대 물리학의 기점이 된 실험 데이터를 모델에 제시하고 고전적 가정을 비판하도록 유도했다. 모델은 빛이 연속적인 파동이 아니라 '불연속적인 에너지 묶음'이어야 한다는 점을 식별해냈으며, 이는 아인슈타인의 광양자설과 일맥상통한다. 또한 가속되는 엘리베이터 사고 실험에서 중력이 빛을 휘게 한다는 일반 상대성 이론의 핵심 직관을 일부 재현했다.


근거
- 모델은 광전 효과 실험 결과에 대해 빛이 '불연속적인 부분(disconnected parts)'으로 구성되어 있다고 선언했다. — Results 섹션 및 Photoelectric Effect 평가 부분
용어 해설
- 흑체 복사(Blackbody Radiation)
- — 모든 파장의 전자기파를 완전히 흡수하고 방출하는 가상의 물체인 흑체에서 나오는 빛의 분포이다. 고전 역학으로는 짧은 파장에서 에너지가 무한대로 발산하는 문제를 해결하지 못했으나, 플랑크가 에너지를 불연속적인 단위로 가정하며 양자 역학의 시초가 되었다.
- 광전 효과(Photoelectric Effect)
- — 금속 표면에 빛을 비추었을 때 전자가 튀어나오는 현상이다. 빛의 세기가 아닌 진동수에 따라 전자의 방출 여부가 결정된다는 사실을 통해 아인슈타인이 빛의 입자성(광자)을 증명하여 노벨 물리학상을 수상한 핵심 원리이다.
- 친칠라 스케일링 법칙(Chinchilla Scaling Laws)
- — 모델의 파라미터 수와 학습 데이터 토큰 수 사이의 최적의 비율(약 1:20)을 정의한 법칙이다. 한정된 컴퓨팅 자원 내에서 모델 성능을 극대화하기 위한 가이드라인으로 활용되며, 최근에는 이 법칙을 넘어 더 많은 데이터를 학습시키는 경향도 나타난다.
- 지도 미세 조정(SFT)
- — 사전 학습된 모델에 지시어와 답변 쌍으로 구성된 데이터를 학습시켜 특정 작업이나 대화 형식을 따르도록 만드는 기법이다. 본문에서는 1900년 이전 텍스트를 바탕으로 모델이 질문에 답변할 수 있도록 유도하는 과정에서 사용되었다.
- 리인포스 알고리즘(REINFORCE)
- — 강화학습에서 정책 경사법의 가장 기본적인 알고리즘으로, 보상의 기댓값을 최대화하도록 모델의 파라미터를 직접 업데이트한다. 본문에서는 LLM을 판별자로 사용하여 모델의 물리적 추론 결과에 보상을 주는 방식으로 적용되었다.
기술
- PyTorch
- nanochat
- Muon optimizer
- REINFORCE
- GPT-2 tokenizer
활용 사례
- 과학적 가설 생성 시스템
- 역사적 인물/시대 시뮬레이션 챗봇
- 데이터 제한 환경에서의 도메인 특화 모델 학습
언급된 리소스
Demogpt1900 Demo
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 28.수집 2026. 04. 28.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.