용어 해설
- 텍스트-투-비디오 디퓨전(Text-to-Video Diffusion)
- — 텍스트 조건을 받아 노이즈에서 점진적으로 비디오를 생성하는 확률적 생성 모델 계열이다. 여러 단계의 역노이즈 과정을 통해 시간적 일관성과 텍스트-비전 정렬을 학습하며, 본문에서는 이 사전학습된 백본을 표현 학습기로 재활용한다.
- 정류화 흐름(Rectified Flow)(Rectified Flow)
- — 디퓨전 계열에서 노이즈와 원본 간의 속도(velocity)를 예측하는 변형 학습목표이다. 본 논문에서는 velocity 예측을 이용해 t=0 조건으로 출력 부호를 반전시켜 깨끗한 잠재공간 특징을 추출한다.
- 잠재 공간 디퓨전(Latent Diffusion)
- — 이미지·비디오를 저차원 잠재 공간으로 인코딩한 뒤 잠재 표현에서 디퓨전 모델을 학습하는 방식이다. 인코더·디코더(VAE)와 결합해 계산 비용을 줄이며 고해상도 출력을 효율적으로 처리하는 핵심 구조이다.
- 레이맵(Raymap)
- — 카메라 포즈와 관련된 다채널 정보를 2D 픽셀 공간에 배치해 표현하는 방식이다. 본문에서는 6채널 카메라 정보를 3채널 RGB 제약에 맞추어 중앙/주변 영역으로 공간 분할하여 표현하였다.
- 학습 가능한 토큰(Learnable Tokens)
- — 영상 잠재토큰에 추가되는 프레임별 학습 가능한 쿼리 토큰으로, 이를 통해 희소한 좌표형 출력(2D/3D 관절 좌표 등)을 예측한다. 본문에서는 3D RoPE와 위치 보간을 사용해 시공간 정보를 부여했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





