토큰 지평선 학습률 스케일링
작은 토큰 규모(Proxy)에서 탐색한 최적 학습률을 타깃 토큰 규모로 변환하기 위한 스케일링 법칙으로, LR*(D_target) ≈ LR*(D_proxy) · (D_target / D_proxy)^{-β} 공식을 사용해 긴 토큰 지평선에서 안정적인 학습률 설정을 확보한다.