용어 해설
- 지오메트리 버퍼(G-buffer)
- — 렌더링 파이프라인에서 깊이, 노말, 알베도, 러프니스, 금속성 등 장면의 물리적 특성을 채널별로 저장한 버퍼들로서 본 논문에서는 이들 G-buffer를 연속 비디오 조건으로 인코딩해 생성 모델의 입력으로 사용해 장면 구조와 물리적 상호작용을 보존하는 조건 정보로 활용한다.
- 변분 오토인코더(VAE)
- — 입력 이미지를 잠재 공간으로 압축하고 다시 복원하는 신경망 구조로서 AlayaRenderer 계열은 Wan 계열의 causal 3D VAE를 사용해 프레임 및 G-buffer 채널을 잠재 표현으로 변환하고 복원 과정의 비용이 전체 추론 지연에 큰 영향을 주기 때문에 경량화된 VAE 대체가 핵심이었다.
- 분류기 없는 가이던스(Classifier-Free Guidance)
- — 텍스트 조건과 무조건 입력을 결합해 생성 방향을 강화하는 기법으로서 원본 교사 모델은 각 denoising 단계에서 두 번의 네트워크 평가를 사용했으나 논문은 이 동작을 교사 예측으로부터 학생 가중치에 증류해 단일 네트워크 평가로 동작하도록 만들었다.
- 단계적 증류(Progressive Distillation)
- — 긴 denoising 스케줄을 소수 스텝으로 줄일 때 발생하는 불안정성을 완화하기 위해 중간 단계 스케줄을 순차적으로 학습시키는 방법으로서 본문에서는 50스텝 가이던스 증류 후 32,16,8,4 스텝 순으로 학생을 적응시켜 최종 4스텝 학생의 학습을 안정화했다.
- 평균 흐름 증류(Mean Flow Distillation)
- — 교사 분포의 흐름 정보를 학생 네트워크가 모사하도록 하는 분포 정제 단계로서 자기 롤아웃 환경에서 학생이 자신의 예측만으로 학습하도록 구성해 배포 시의 train test 불일치를 줄이고 4스텝에서의 시각 품질을 향상시키는 데 사용되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



