본문으로 건너뛰기
HF Daily Papers조회 1

테스트 시간 스케일링이 오버트레이닝을 연산 최적화로 만드는 이유

기존의 LLM 학습 법칙은 학습 단계의 효율성만 강조했지만, 실제 서비스에서는 추론 비용이 전체 예산의 큰 비중을 차지합니다. 이 논문은 추론 시 여러 번 시도하여 정답을 찾는 '테스트 시간 스케일링' 상황을 고려할 때, 모델을 기존 상식보다 훨씬 더 많이 학습(오버트레이닝)시키는 것이 전체 비용 대비 성능 면에서 가장 유리함을 수학적으로 입증했습니다.

용어 해설

패스-앳-k(pass@k)
모델이 독립적으로 k번의 답변을 생성했을 때, 그중 최소 하나가 정답일 확률을 측정하는 지표이다. 복잡한 추론 문제에서 모델의 성능을 평가할 때 주로 사용되며, 시도 횟수 k가 늘어날수록 정답을 맞힐 확률이 비선형적으로 증가하는 특성을 가진다.
과잉 학습(Overtraining)
특정 모델 크기에 대해 권장되는 최적 데이터 양보다 훨씬 더 많은 데이터를 사용하여 학습하는 기법이다. 학습 단계에서는 연산 효율이 떨어질 수 있으나, 결과적으로 모델의 지식 밀도를 높여 추론 시 더 작은 모델로도 높은 성능을 내게 함으로써 전체 서비스 비용을 절감하는 전략으로 활용된다.
스케일링 법칙(Scaling Laws)
모델의 파라미터 수, 학습 데이터 양, 연산량 사이의 상관관계를 수학적 함수로 나타낸 법칙이다. 특정 자원 예산 내에서 어떤 요소에 집중 투자해야 모델의 성능(손실 함수 값)을 최적화할 수 있는지 예측하는 설계 도구 역할을 한다.
테스트 시간 스케일링(Test-time Scaling)
모델의 학습이 끝난 후, 실제 추론(테스트) 단계에서 더 많은 연산 자원을 투입하여 성능을 높이는 방법이다. 대표적으로 여러 번 샘플링하여 최선의 답을 고르거나, 복잡한 사고 과정을 거치게 하는 방식이 있으며, 모델 크기를 키우지 않고도 성능을 개선할 수 있는 핵심 수단이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 01.수집 2026. 04. 07.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.