용어 해설
- 멀티모달 확산 트랜스포머(MMDiT)
- — 비디오와 오디오 등 서로 다른 형태의 데이터를 동시에 처리하기 위해 설계된 확산 모델 기반의 트랜스포머 구조입니다. 각 데이터 스트림이 독립적으로 흐르면서도 중간에 정보를 교환하여 멀티모달 데이터 간의 높은 정렬 성능을 보장하는 것이 핵심입니다.
- 인페인팅(Inpainting)
- — 이미지나 영상의 손상된 부분을 복원하거나 특정 영역을 마스킹한 뒤 주변 맥락에 어울리는 새로운 콘텐츠로 채워 넣는 기술입니다. 이 모델에서는 이를 확장하여 객체 제거, 배경 교체 등 모든 편집 작업을 수행하는 통합 인터페이스로 활용합니다.
- 플로우 매칭(Flow Matching)
- — 확산 모델의 학습을 더 효율적으로 만들기 위한 프레임워크로, 노이즈에서 데이터로 가는 경로(벡터장)를 직접 학습합니다. 기존 확산 모델보다 학습 속도가 빠르고 생성 품질이 안정적이며, 특히 고해상도 멀티모달 데이터 학습에 유리합니다.
- 회전 위치 임베딩(RoPE)
- — 토큰의 상대적인 위치 정보를 사인/코사인 함수를 이용해 회전 행렬 형태로 주입하는 기법입니다. 시퀀스 길이에 유연하게 대응할 수 있으며, 특히 비디오와 오디오처럼 토큰 수가 다른 데이터 간의 시간적 위치를 맞추는 데 효과적입니다.
- 비디오 희소 어텐션(VSA)
- — 비디오 데이터의 방대한 토큰 중 중요한 영역에만 선택적으로 주의(Attention)를 기울이는 기법입니다. 전체 토큰 간의 관계를 모두 계산하는 대신 핵심적인 공간-시간 큐브에 집중함으로써 연산량을 획기적으로 줄여 고해상도 처리를 가능하게 합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.