pretraining-tokens
사전학습 토큰량
모델을 사전학습할 때 소비된 토큰의 총량으로, 모델이 학습한 언어·시각·오디오 분포의 폭과 다양성을 가늠하는 지표이다. 대규모 토큰량은 일반화 능력에 기여하지만 데이터 품질과 중복 처리 방식도 성능에 결정적 영향을 미친다. 단순 토큰 수 증가만으로 성능이 비례하지 않으므로 학습 레시피가 중요하다.
사전학습 토큰량
모델을 사전학습할 때 소비된 토큰의 총량으로, 모델이 학습한 언어·시각·오디오 분포의 폭과 다양성을 가늠하는 지표이다. 대규모 토큰량은 일반화 능력에 기여하지만 데이터 품질과 중복 처리 방식도 성능에 결정적 영향을 미친다. 단순 토큰 수 증가만으로 성능이 비례하지 않으므로 학습 레시피가 중요하다.