본문으로 건너뛰기

비디오 생성 모델을 범용 시각 학습기로 재정의한 GenCeption

GenCeption은 텍스트-투-비디오 생성 사전학습을 피드포워드 인식기로 전환해 단일 모델로 깊이·법선·세그멘테이션·3D 관절 등 다양한 시각 과제를 적은 파인튜닝 데이터로 달성한다.

용어 해설

텍스트-투-비디오 디퓨전(Text-to-Video Diffusion)
텍스트 조건을 받아 노이즈에서 점진적으로 비디오를 생성하는 확률적 생성 모델 계열이다. 여러 단계의 역노이즈 과정을 통해 시간적 일관성과 텍스트-비전 정렬을 학습하며, 본문에서는 이 사전학습된 백본을 표현 학습기로 재활용한다.
정류화 흐름(Rectified Flow)(Rectified Flow)
디퓨전 계열에서 노이즈와 원본 간의 속도(velocity)를 예측하는 변형 학습목표이다. 본 논문에서는 velocity 예측을 이용해 t=0 조건으로 출력 부호를 반전시켜 깨끗한 잠재공간 특징을 추출한다.
잠재 공간 디퓨전(Latent Diffusion)
이미지·비디오를 저차원 잠재 공간으로 인코딩한 뒤 잠재 표현에서 디퓨전 모델을 학습하는 방식이다. 인코더·디코더(VAE)와 결합해 계산 비용을 줄이며 고해상도 출력을 효율적으로 처리하는 핵심 구조이다.
레이맵(Raymap)
카메라 포즈와 관련된 다채널 정보를 2D 픽셀 공간에 배치해 표현하는 방식이다. 본문에서는 6채널 카메라 정보를 3채널 RGB 제약에 맞추어 중앙/주변 영역으로 공간 분할하여 표현하였다.
학습 가능한 토큰(Learnable Tokens)
영상 잠재토큰에 추가되는 프레임별 학습 가능한 쿼리 토큰으로, 이를 통해 희소한 좌표형 출력(2D/3D 관절 좌표 등)을 예측한다. 본문에서는 3D RoPE와 위치 보간을 사용해 시공간 정보를 부여했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 10.수집 2026. 07. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.