spatio-temporal-tokenization
시공간 토크나이제이션
디퓨전 백본에서 추출한 중간 피쳐를 공간적 위치, 시간 위치, 그리고 카메라 레이 공간 인코딩을 더한 토큰으로 변환하는 절차이다. 토큰은 디코더가 프레임 간 정렬·관절 위치·카메라 다양성을 처리할 수 있게 해주며, 손·관절을 분리된 신호 축으로 읽어내는 기반이 된다. 논문에서는 이 토크나이제이션을 통해 단일 디코더로 이질적 증거를 병렬로 처리했다.
시공간 토크나이제이션
디퓨전 백본에서 추출한 중간 피쳐를 공간적 위치, 시간 위치, 그리고 카메라 레이 공간 인코딩을 더한 토큰으로 변환하는 절차이다. 토큰은 디코더가 프레임 간 정렬·관절 위치·카메라 다양성을 처리할 수 있게 해주며, 손·관절을 분리된 신호 축으로 읽어내는 기반이 된다. 논문에서는 이 토크나이제이션을 통해 단일 디코더로 이질적 증거를 병렬로 처리했다.