용어 해설
- 시각-언어 모델(VLM)
- — 이미지와 텍스트를 동시에 이해하고 처리할 수 있는 인공지능 모델이다. 이미지 내의 객체, 관계, 맥락을 텍스트로 설명하거나 텍스트 지시를 이미지 처리에 반영하는 능력을 갖추어 멀티모달 작업의 핵심 역할을 한다.
- 조건부 흐름 매칭(CFM)
- — 데이터 분포 사이의 확률 경로를 정의하고 이를 따라가는 벡터 필드를 학습하는 생성 모델 기법이다. 확산 모델보다 효율적인 샘플링이 가능하며, 특정 조건에 맞는 데이터를 생성하는 데 정교한 제어력을 제공한다.
- 은닉 상태(Hidden State)
- — 신경망의 중간 레이어에서 출력되는 벡터 값으로, 입력 데이터의 추상화된 특징 정보를 담고 있다. 이 논문에서는 확산 모델의 중간 단계 은닉 상태를 추출하여 3D 생성 모델의 가이드 신호로 활용한다.
- 교차 어텐션(Cross-Attention)
- — 두 개의 서로 다른 데이터 시퀀스 간의 상관관계를 계산하는 메커니즘이다. 3D 생성 모델이 입력 이미지나 VLM에서 추출된 외부 지식 정보를 참조하여 결과물을 생성할 수 있도록 연결하는 다리 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.