용어 해설
- 통합 다중모달 모델(Unified Multimodal Model)
- — 텍스트와 이미지를 동시에 입력·출력할 수 있도록 설계된 생성형 모델로, 텍스트 생성과 이미지 생성을 동일한 네이티브 출력 공간으로 취급해 서로 다른 형태의 시각 과제(기호화된 레코드, 밀집 이미지 맵, 혼합 출력)를 한 모델 내부에서 일관되게 표현하고 학습할 수 있게 한다.
- 지시-응답 코퍼스(Instruction-Response Corpus)
- — 자연어 지시문과 그에 대응하는 디코더블 응답(텍스트, 이미지, 텍스트+이미지)을 한 쌍으로 정형화한 데이터셋으로, 서로 다른 시각 어노테이션을 통일된 생성 목표로 변환해 모델에 직접 지도학습 신호를 제공한다.
- 정정 흐름(정체화된 흐름)(Rectified-Flow)
- — 이미지 생성 경로에서 시각 타깃(마스크, 깊이, 노멀 등)을 VAE 잠재공간으로 매핑한 뒤, 복원 과정을 최적화하기 위해 사용하는 학습 목적 함수로서 이미지 생성 품질과 디코딩의 안정성을 높이는 역할을 한다.
- 포인트 맵(Point Map)
- — 다중뷰 장면 복원을 위해 각 뷰의 픽셀 위치마다 정규화된 3차원 좌표(X,Y,Z)를 RGB 채널에 인코딩한 이미지 형태의 밀집 기하 정보로, 이미지 디코더 출력으로부터 직접 복원 가능하도록 설계된다.
- 포즈 토크나이제이션(Pose Tokenization)
- — 쿼터니온 회전, 단위 이동 벡터, 스케일과 같은 연속적 포즈 파라미터를 유한한 어휘 토큰으로 양자화하여 모델의 텍스트 생성 공간에서 카메라 포즈를 구조화된 시퀀스로 출력하게 만드는 기법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







