상태 전이 마스크
스트리밍 학습에서 모든 상태 토큰에 균일 손실을 주면 Silence에 편향되는 문제와 전이 위치만 학습하면 시각 증거 활용을 무시하는 문제가 공존한다. 전이 위치는 전부 유지하고 나머지 지속 위치에서 전이 수와 같은 수를 무작위로 골라 손실을 유지하는 방식으로 균형을 맞춘다.