self-rollout
셀프 롤아웃
학습 시 모델이 실제 추론과 동일하게 이전에 모델이 생성한 프레임들을 입력으로 사용해 순차적으로 생성하는 절차이다. Teacher-Forcing과 달리 지상 정답이 아닌 자체 생성 히스토리를 기반으로 학습하여 노출 바이어스(exposure bias)를 줄이는 목적을 가진다. 그러나 롤아웃 과정에서 생성된 KV를 고정하면 이후 손실이 이 KV의 생성 경로를 교정하지 못하는 문제가 발생할 수 있다.
셀프 롤아웃
학습 시 모델이 실제 추론과 동일하게 이전에 모델이 생성한 프레임들을 입력으로 사용해 순차적으로 생성하는 절차이다. Teacher-Forcing과 달리 지상 정답이 아닌 자체 생성 히스토리를 기반으로 학습하여 노출 바이어스(exposure bias)를 줄이는 목적을 가진다. 그러나 롤아웃 과정에서 생성된 KV를 고정하면 이후 손실이 이 KV의 생성 경로를 교정하지 못하는 문제가 발생할 수 있다.