용어 해설
- 확산 트랜스포머(DiT)
- — 기존의 U-Net 구조 대신 Transformer 아키텍처를 Diffusion 모델의 백본으로 사용하는 설계이다. 데이터의 장거리 의존성을 더 잘 파악하고 모델 크기 확장에 유리하여 고화질 비디오 생성에 널리 쓰인다.
- 회전 위치 임베딩(RoPE)
- — 토큰의 위치 정보를 벡터의 회전 변환을 통해 인코딩하는 기법이다. 상대적인 위치 관계를 효과적으로 학습할 수 있게 하며, 비디오의 시공간적 일관성을 유지하는 데 중요한 역할을 한다.
- 잠재 공간(Latent Space)
- — 고차원 데이터(이미지, 비디오)를 압축하여 핵심 특징만을 남긴 저차원 벡터 공간이다. 이 공간에서 연산을 수행하면 계산 효율성이 극대화되며 추상적인 특징 제어가 용이해진다.
- 지도 미세 조정(SFT)
- — 사전 학습된 모델을 특정 데이터셋과 레이블을 사용하여 추가 학습시키는 과정이다. 이 논문에서는 인물의 외형과 움직임 신호를 연결하기 위한 첫 번째 학습 단계로 활용된다.
- 보상 모델(Reward Model)
- — 모델의 출력이 인간의 선호도나 특정 기준에 얼마나 부합하는지 점수를 매기는 별도의 모델이다. 강화 학습 과정에서 생성 모델이 더 나은 결과물을 만들도록 가이드하는 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.