sensenova/SenseNova-Vision-7B-MoT
SenseNova-Vision은 텍스트 생성, 이미지 생성, 혹은 혼합 텍스트·이미지 생성을 통해 다양한 시각 태스크를 하나의 모델로 처리하는 통합 멀티모달 비전 시스템이다.
학습 방식 · 모델은 SenseNova-Vision-Corpus-50M이라는 대규모 비전 지침-응답 코퍼스로 학습되었으며 이 코퍼스는 다양한 주석을 공통 스키마로 변환하여 텍스트, 이미지, 텍스트-이미지 혼합형 타깃을 제공한다. 학습은 혼합 태스크 방식으로 이루어져 한 모델이 구조화된 텍스트 출력과 픽셀 정렬 출력을 동시에 학습하도록 설계되었다. 이로 인해 모델은 단일 디코더 파이프라인으로 여러 유형의 시각 예측을 생성할 수 있게 되었다.
TL;DR
SenseNova-Vision은 텍스트 생성, 이미지 생성, 그리고 텍스트·이미지 혼합 생성이라는 세 가지 출력 공간으로 이질적 시각 태스크를 통일하여 단일 모델로 처리하는 접근을 제시한다. 모델은 자연어 지시와 시각 프롬프트를 입력으로 받아 정규화된 텍스트 레코드나 결정적 인코딩의 이미지형 타깃을 생성하고, 후처리 규칙으로 표준 벤치마크 형식으로 디코딩할 수 있다. 공개된 벤치마크에서 탐지와 깊이, 다중뷰 재구성 등에서 경쟁력 있는 수치를 보고했으나 출력 파싱 규칙과 프롬프트 민감성으로 인한 사용상 제약이 존재한다. 따라서 범용성은 높지만 특정 전문화된 태스크에서 전용 모델보다 낮을 수 있고 실제 배포 전엔 결과 검증 절차가 필요하다. 이 모델은 대규모 통합 코퍼스와 단일 디코더 설계를 통해 2D 구조부터 다중뷰 3D까지 광범위한 시각 문제를 하나의 프레임워크로 다루는 옵션을 제공한다.
핵심 포인트
- 태스크별 전용 헤드를 사용하지 않고 텍스트, 이미지, 혼합 출력을 통일된 생성 공간으로 재구성한 아키텍처적 접근이 핵심 차별점이다.
- SenseNova-Vision-Corpus-50M으로 표현된 대규모 지침-응답 형식의 통합 주석 코퍼스를 학습 데이터로 사용하여 다양한 주석 유형을 결정적 규칙으로 통일했다.
- 출력 결과를 벤치마크 호환 형식으로 디코딩하기 위한 명확한 인코딩 규약을 채택하여 텍스트 레코드와 이미지형 타깃 모두에서 기존 데이터셋과의 호환성을 보장했다.
- 단일 모델로 2D 구조화 작업부터 밀집 기하 예측, 다중뷰 3D 재구성까지 아우를 수 있도록 설계되어 범용 비전 모델 성격이 강하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Structured Visual Understanding COCO-Com. | bbox mAP | 56.6 | — |
| Structured Visual Understanding HR/RefCOCOg | bbox Accuracies | 80.2 / 79.6 / 80.5 | — |
| Dense Geometric Prediction NYUv2 | AbsRel / δ1 | 4.0 / 98.1 | — |
| Multi-View Reconstruction ETH3D | Acc. / Comp. / F1 | 0.301 / 0.175 / 72.2 | — |
| Depth NYUv2 (comparison table) | AbsRel | 4.0 | MoGe-2 3.5 is lower on AbsRel |
이미지 분석



51
LIKES
544
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.