전체 토큰 평균 손실
배치 내 모든 토큰 손실을 균등하게 평균하여 샘플마다 마스크된 토큰 수가 달라지는 경우에 특정 샘플(예: 작은 t 값으로 가중치가 큰 항)을 과도하게 영향력 있게 만드는 현상을 완화하는 집계 방식이다. 시퀀스 단위 평균과 대비되어 배치 간 변동성을 줄이고 학습 안정성을 높이는 역할을 한다. 논문에서 이 기법은 diffusion 학습에서 성능 향상에 기여했다.