쌍으로 정렬된 비디오 학습 데이터
쌍으로 정렬된 비디오 학습 데이터는 동일 인물이 동일한 동작을 서로 다른 장면이나 조명에서 수행한 두 비디오로 구성되는 데이터다. 입력-출력 쌍이 있어 supervised 학습이 가능하며 처리 단계에서는 한쪽 비디오의 외형·조명을 기준으로 다른 쪽의 표현을 학습시키는 방식으로 사용된다. 원문은 이런 쌍을 대규모로 수집하는 것이 매우 어려워서 합성 방식으로 쌍을 만드는 전략을 사용했다고 기술하고 있다.