TL;DR
기존 Chinchilla scaling은 고정된 학습 연산량을 모델 크기와 training token 사이에 배분하지만, reasoning model은 추론 단계에서도 여러 답변을 생성하고 검증하는 추가 비용을 사용합니다. Train-to-Test, 즉 T² scaling laws는 모델 크기 N과 데이터량 D에 반복 샘플 수 k를 결합하고, 동일한 inference budget에서 작은 모델이 더 많은 샘플을 생성하는 효과까지 계산합니다. 그 결과 compute-optimal한 지점이 표준 기준보다 훨씬 많은 토큰으로 학습한 작은 모델 쪽으로 이동했으며, LFM2.5-350M의 매개변수당 약 80,000 tokens 사례도 이 예측 영역에 가까웠습니다. 과잉학습 체크포인트는 held-out 외삽과 real·synthetic benchmark 비교에서 Chinchilla-optimal 체크포인트보다 높은 성능을 냈고, fine-tuning 이후에도 같은 결론이 유지됐습니다.
빠른 이해
새로운 점
학습 비용만 최적화하던 scaling law에 반복 추론 비용을 결합해 작은 모델의 대규모 overtraining을 compute-optimal 전략으로 예측했습니다.
핵심 메커니즘
모델 크기 N, 학습 데이터량 D, 테스트 시점 반복 샘플 수 k를 하나의 비용 제약 안에서 함께 최적화합니다. 모델은 여러 completion을 병렬 생성하고 verifier로 정답 여부를 판별하며, 총 inference budget을 고정하기 위해 와 을 사용합니다. 그 결과 작은 모델은 큰 모델보다 더 많은 샘플을 생성할 수 있고, 손실 기반 모델과 Beta regression 기반 pass@k 모델 모두 최적 배분을 작은 모델과 많은 training token 쪽으로 이동시킵니다.
핵심 수치
- Chinchilla 경험칙: 약 20 training tokens per parameter- 표준 pre-training scaling의 대표적인 tokens per parameter 기준
- LFM2.5-350M 학습량: 350 million parameters, 28 trillion tokens- 본문 계산 기준 약 80,000 tokens per parameter
- pass@k: 1−(1−p)^k- p는 단일 샘플의 정답 확률, k는 반복 샘플 수
- 추론 비용 근사: Cinf=2Nk- N은 모델 크기, k는 반복 샘플 수이며 동일 비용 비교에 사용
- 검증 결과: T² overtrained checkpoint가 Chinchilla-optimal checkpoint보다 일관되고 상당히 높은 성능- real 및 synthetic benchmark, 동일 inference budget 비교
섹션별 상세
학습 스케일링의 기준
추론 단계의 반복 샘플링
T² 스케일링 법칙의 구성
과잉학습으로 이동한 최적점
외삽과 벤치마크 검증
Post-training 이후에도 유지된 결론
용어 해설
- 사전 학습 스케일링 법칙(Pre-training Scaling Laws)
- — 고정된 학습 연산량을 모델 크기와 학습 데이터량에 어떻게 배분할지 추정하는 경험적 규칙입니다. 여러 크기의 모델을 학습해 손실 변화를 맞추고, 더 큰 연산 예산에서 최적의 매개변수 수와 토큰 수 조합을 예측합니다.
- 테스트 시점 스케일링(Test-Time Scaling)
- — 모델을 학습한 뒤 추론 단계에서 여러 답변을 생성하고 검증해 성능을 높이는 방식입니다. 추가 추론 연산량을 사용해 단일 답변의 오류를 보완하며, 반복 샘플 수와 검증 절차가 핵심 변수가 됩니다.
- Chinchilla 스케일링(Chinchilla Scaling)
- — 고정된 학습 연산량에서 모델 매개변수 수와 학습 토큰 수를 균형 있게 배분하는 기준입니다. 이 글에서는 매개변수 하나당 약 20개의 training token을 사용하는 경험칙으로 제시되며, 추론 비용은 직접 포함하지 않습니다.
- 병렬 샘플링(Parallel Sampling)
- — 하나의 문제에 대해 모델이 여러 completion을 독립적으로 생성한 뒤 verifier로 답을 검사하고 통과한 결과를 선택하는 추론 방식입니다. 샘플 수를 늘리면 정답을 한 번 이상 얻을 확률이 높아지지만 추론 연산량도 함께 증가합니다.
- pass@k
- — k개의 독립적인 답변 중 하나 이상이 정답일 확률을 나타내는 지표입니다. 단일 샘플 정답 확률이 p일 때 로 계산하며, k가 커질수록 정답을 얻을 기회가 늘어나는 구조를 측정합니다.
- Beta Regression
- — 문제별 정답 확률이 서로 다르다는 점을 반영하기 위해 성공 확률의 분포를 Beta 분포로 모델링하는 통계 방법입니다. 문제 난이도의 이질성을 평균값 하나로 뭉개지 않고, 그 분포에서 기대 pass@k를 계산하는 데 사용됩니다.
- IsoFLOP 플롯(IsoFLOP Plot)
- — 동일한 연산 예산에서 모델 크기와 데이터량의 여러 조합을 비교하는 그래프입니다. 각 예산 곡선의 최저점이 손실 기준의 최적 조합을 나타내며, 테스트 시점 스케일링을 넣으면 최저점이 더 작은 모델과 많은 학습 토큰 쪽으로 이동합니다.
기술
- Train-to-Test (T²) scaling laws
- Chinchilla scaling
- parallel sampling
- pass@k
- Beta regression
- supervised fine-tuning
- reinforcement learning
- IsoFLOP
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.