텍스트·이미지·혼합 생성으로 2D 구조부터 다중뷰 3D까지 처리하는 단일 비전 모델
SenseNova-Vision은 텍스트 생성, 이미지 생성, 혹은 혼합 텍스트·이미지 생성을 통해 다양한 시각 태스크를 하나의 모델로 처리하는 통합 멀티모달 비전 시스템이다.
TL;DR
SenseNova-Vision은 텍스트 생성, 이미지 생성, 그리고 텍스트·이미지 혼합 생성이라는 세 가지 출력 공간으로 이질적 시각 태스크를 통일하여 단일 모델로 처리하는 접근을 제시한다. 모델은 자연어 지시와 시각 프롬프트를 입력으로 받아 정규화된 텍스트 레코드나 결정적 인코딩의 이미지형 타깃을 생성하고, 후처리 규칙으로 표준 벤치마크 형식으로 디코딩할 수 있다. 공개된 벤치마크에서 탐지와 깊이, 다중뷰 재구성 등에서 경쟁력 있는 수치를 보고했으나 출력 파싱 규칙과 프롬프트 민감성으로 인한 사용상 제약이 존재한다. 따라서 범용성은 높지만 특정 전문화된 태스크에서 전용 모델보다 낮을 수 있고 실제 배포 전엔 결과 검증 절차가 필요하다. 이 모델은 대규모 통합 코퍼스와 단일 디코더 설계를 통해 2D 구조부터 다중뷰 3D까지 광범위한 시각 문제를 하나의 프레임워크로 다루는 옵션을 제공한다.
핵심 역량
- 모델은 자연어 명령어와 선택적 시각 프롬프트를 결합하여 객체의 바운딩 박스와 키포인트를 정규화된 텍스트 레코드로 생성할 수 있다. 출력 텍스트는 좌표 정규화 및 구조화 필드를 포함하므로 표준 벤치마크 형식으로 파싱 가능하다. 이 동작은 탐지와 참조 지시 작업에서 일관된 텍스트 출력 파이프라인을 제공한다.
- 모델은 깊이 맵과 표면 노멀 같은 픽셀-정렬 기하 정보의 이미지형 출력을 생성할 수 있다. 이러한 출력은 결정적 인코딩 규칙을 통해 깊이 단위와 색 코딩 방식으로 인코딩되어 후처리로 벤치마크 지표를 계산할 수 있다. 이로 인해 단안 깊이와 노멀 예측이 동일한 생성 모델에서 처리된다.
- 모델은 텍스트 라벨과 바이너리 마스크 또는 컬러 마스크를 동시에 생성하는 혼합 텍스트·이미지 출력을 통해 다중 인스턴스 분할과 대화형 분할을 처리할 수 있다. 텍스트는 객체 식별 및 메타데이터를 제공하고 이미지는 픽셀 단위 마스크를 제공하므로 복합적 작업에 적합하다. 이 방식은 지시어에 따라 다양한 분할 변형을 유연하게 생성한다.
강점
- SenseNova-Vision은 구조화된 시각 이해 분야에서 COCO-Com. 기준 56.6을 기록하고 HR/RefCOCOg 기준에서 80.2 / 79.6 / 80.5를 달성하여 동급의 제너럴리스트 모델과 비교해 우수한 탐지 및 참조 성능을 보였다. 이러한 수치는 동일 모델에서 다양한 탐지·참조 태스크를 일관된 텍스트 출력으로 처리한 결과이다. 표준 파서로 텍스트를 변환하면 기존 데이터셋 호환성이 확보된다.
- 단안 깊이 예측에서는 NYUv2 AbsRel 4.0과 δ1 98.1을 보고하여 밀집 기하 예측 성능이 상위권임이 확인되었다. 표면 노멀 예측에서도 ScanNet 평균 오류 12.8과 NYUv2 14.4를 달성하여 기하학적 출력의 품질이 실무적 활용 수준에 근접했다. 이 결과는 이미지형 타깃을 결정적 인코딩으로 학습시킨 설계가 기여했다.
훈련 방식
모델은 SenseNova-Vision-Corpus-50M이라는 대규모 비전 지침-응답 코퍼스로 학습되었으며 이 코퍼스는 다양한 주석을 공통 스키마로 변환하여 텍스트, 이미지, 텍스트-이미지 혼합형 타깃을 제공한다. 학습은 혼합 태스크 방식으로 이루어져 한 모델이 구조화된 텍스트 출력과 픽셀 정렬 출력을 동시에 학습하도록 설계되었다. 이로 인해 모델은 단일 디코더 파이프라인으로 여러 유형의 시각 예측을 생성할 수 있게 되었다.
알아두면 좋은 것
- SenseNova-Vision은 태스크별 전용 헤드를 사용하지 않고 텍스트 생성, 이미지 생성, 혼합 생성이라는 세 가지 출력 공간으로 이질적 시각 태스크를 통일한다. 모델 출력은 디코딩 규칙으로 박스, 포인트, OCR 문자열, 마스크, 깊이 맵, 노멀 맵, 포인트 맵, 카메라 기록 등 표준 벤치마크 형식으로 변환 가능하다. 이 설계가 동일 모델로 구조화된 2D 이해와 밀집 기하학 예측, 다중뷰 3D 기하를 모두 다루는 근거가 된다.
- 학습은 SenseNova-Vision-Corpus-50M이라는 대규모 지침-응답 형식의 비전 코퍼스를 활용하여 다양한 주석을 공통 스키마로 변환한 데이터로 수행되었다. 코퍼스는 텍스트 표기, 이미지형 타깃, 혹은 텍스트·이미지 혼합형 타깃을 포함하여 각 태스크의 출력 규격을 결정적으로 정의한다. 데이터의 통합은 모델이 여러 작업군을 단일 인터페이스로 학습하도록 한다.
- 평가는 구조화된 시각 이해, 밀집 기하 예측, 분할, 다중뷰 기하학 등 여러 벤치마크에 대해 자연어 지시를 통해 수행되며 텍스트 출력을 파싱하거나 이미지 출력을 디코딩하여 기존 지표와 비교했다. 평가 결과는 탐지와 깊이, 다중뷰 재구성 등에서 경쟁력 있는 수치를 보고한다. 다만 출력 파싱 규칙과 프롬프트 민감성 때문에 실제 적용 시 결과 검증이 요구된다.
기술적 특징
- 모델은 다양한 시각 태스크를 텍스트 생성, 이미지 생성, 텍스트-이미지 혼합 생성의 세 가지 기본 출력 공간으로 재표현하여 태스크별 헤드를 제거했다. 이 설계는 하나의 디코더 인터페이스로 서로 다른 출력 타입을 생성하게 하고 출력에 대한 후처리 규칙으로 표준 벤치마크 형식으로 변환할 수 있게 만든다. 결과적으로 구조화된 레코드와 픽셀 맵을 동일한 파이프라인에서 생성하는 것이 가능해졌다.
- 명령어 조건화와 시각 프롬프트를 결합하여 사용자가 수행할 태스크, 관심 영역, 출력 스키마, 디코딩 규약을 세밀하게 제어하도록 설계되었다. 프롬프트는 자연어 지시문과 마커를 통해 출력 필드와 좌표 체계를 정의하며 모델은 이에 맞춰 텍스트 또는 이미지형 출력을 생성한다. 이 방식은 태스크 변형을 유연하게 처리하는 동시에 프롬프트 민감성 문제를 동반한다.
- 학습 데이터는 SenseNova-Vision-Corpus-50M으로, 서로 다른 주석 형식을 결정적 규칙으로 통합한 대규모 지침-응답 코퍼스를 사용했다. 코퍼스는 박스/포인트/키포인트용 텍스트 레코드와 깊이·노멀용 결정적 이미지 인코딩, 분할용 바이너리 및 컬러 마스크를 포함한다. 데이터 통합 과정이 모델의 범용성과 디코딩 호환성에 핵심 역할을 했다.
- 모델은 단일 디코더로 텍스트 기반 구조화 출력과 픽셀 정렬 이미지 출력을 모두 생성하도록 학습되어 태스크별 손실 함수나 전용 헤드가 필요하지 않다. 이 설계는 모델 아키텍처 단순화를 통해 여러 태스크를 하나의 파이프라인에서 유지보수할 수 있게 만들었다. 다만 태스크별 파싱 로직과 디코딩 규칙은 외부에서 제공되어야 하므로 통합의 이점과 별도의 엔지니어링 필요성이 공존한다.
- 다중뷰 3D 재구성과 카메라 포즈 추정 같은 기하학적 태스크는 입력으로 여러 장의 뷰를 받아 포인트맵과 구조화된 카메라 레코드를 생성하는 방식으로 처리한다. 모델은 각 뷰에 대해 일관된 포인트맵 인코딩을 출력하고 후처리로 재구성 정확도와 완전도를 평가한다. 이 접근은 멀티뷰 입력을 하나의 생성 모델로 정렬된 3D 정보를 산출하는 데 활용되었다.
차별점
- 태스크별 전용 헤드를 사용하지 않고 텍스트, 이미지, 혼합 출력을 통일된 생성 공간으로 재구성한 아키텍처적 접근이 핵심 차별점이다.
- SenseNova-Vision-Corpus-50M으로 표현된 대규모 지침-응답 형식의 통합 주석 코퍼스를 학습 데이터로 사용하여 다양한 주석 유형을 결정적 규칙으로 통일했다.
- 출력 결과를 벤치마크 호환 형식으로 디코딩하기 위한 명확한 인코딩 규약을 채택하여 텍스트 레코드와 이미지형 타깃 모두에서 기존 데이터셋과의 호환성을 보장했다.
- 단일 모델로 2D 구조화 작업부터 밀집 기하 예측, 다중뷰 3D 재구성까지 아우를 수 있도록 설계되어 범용 비전 모델 성격이 강하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Structured Visual Understanding COCO-Com. | bbox mAP | 56.6 | — |
| Structured Visual Understanding HR/RefCOCOg | bbox Accuracies | 80.2 / 79.6 / 80.5 | — |
| Dense Geometric Prediction NYUv2 | AbsRel / δ1 | 4.0 / 98.1 | — |
| Multi-View Reconstruction ETH3D | Acc. / Comp. / F1 | 0.301 / 0.175 / 72.2 | — |
| Depth NYUv2 (comparison table) | AbsRel | 4.0 | MoGe-2 3.5 is lower on AbsRel |
이미지 분석



51
Likes
544
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.