본문으로 건너뛰기

통합 다중모달 생성 관점에서 재정의한 컴퓨터 비전과 SenseNova-Vision

SenseNova-Vision은 텍스트·이미지·혼합 출력으로 다양한 컴퓨터 비전 어노테이션을 통일된 생성 목표로 변환한 50M급 코퍼스와 결합해 단일 UMM로 검출, 세분화, 깊이, 노멀, 다중뷰 3D를 수행했다.

용어 해설

통합 다중모달 모델(Unified Multimodal Model)
텍스트와 이미지를 동시에 입력·출력할 수 있도록 설계된 생성형 모델로, 텍스트 생성과 이미지 생성을 동일한 네이티브 출력 공간으로 취급해 서로 다른 형태의 시각 과제(기호화된 레코드, 밀집 이미지 맵, 혼합 출력)를 한 모델 내부에서 일관되게 표현하고 학습할 수 있게 한다.
지시-응답 코퍼스(Instruction-Response Corpus)
자연어 지시문과 그에 대응하는 디코더블 응답(텍스트, 이미지, 텍스트+이미지)을 한 쌍으로 정형화한 데이터셋으로, 서로 다른 시각 어노테이션을 통일된 생성 목표로 변환해 모델에 직접 지도학습 신호를 제공한다.
정정 흐름(정체화된 흐름)(Rectified-Flow)
이미지 생성 경로에서 시각 타깃(마스크, 깊이, 노멀 등)을 VAE 잠재공간으로 매핑한 뒤, 복원 과정을 최적화하기 위해 사용하는 학습 목적 함수로서 이미지 생성 품질과 디코딩의 안정성을 높이는 역할을 한다.
포인트 맵(Point Map)
다중뷰 장면 복원을 위해 각 뷰의 픽셀 위치마다 정규화된 3차원 좌표(X,Y,Z)를 RGB 채널에 인코딩한 이미지 형태의 밀집 기하 정보로, 이미지 디코더 출력으로부터 직접 복원 가능하도록 설계된다.
포즈 토크나이제이션(Pose Tokenization)
쿼터니온 회전, 단위 이동 벡터, 스케일과 같은 연속적 포즈 파라미터를 유한한 어휘 토큰으로 양자화하여 모델의 텍스트 생성 공간에서 카메라 포즈를 구조화된 시퀀스로 출력하게 만드는 기법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.