손실 마스크
토큰 시퀀스에서 어떤 토큰들이 모델의 출력으로서 학습 신호에 기여해야 하는지와 사용자·시스템·툴 쪽 입력으로 무시해야 하는지를 표기하는 바이너리 마스크로서 정책 그레이디언트 계산에 직접 투입된다.