본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

sensenova/SenseNova-Vision-7B-MoT

객체 검출, 지칭 대상 로컬라이제이션, OCR, GUI 그라운딩, 키포인트, 분할, 추론형 분할, 단안 깊이 추정, 표면 노멀 예측, 포인트맵 기반 다중뷰 3D 재구성 및 카메라 포즈 추정 등 광범위한 시각 인식과 기하학적 예측을 자연어 명령어와 시각 프롬프트로 수행한다.cc-by-nc-4.0

SenseNova-Vision은 텍스트 생성, 이미지 생성, 혹은 혼합 텍스트·이미지 생성을 통해 다양한 시각 태스크를 하나의 모델로 처리하는 통합 멀티모달 비전 시스템이다.

학습 방식 · 모델은 SenseNova-Vision-Corpus-50M이라는 대규모 비전 지침-응답 코퍼스로 학습되었으며 이 코퍼스는 다양한 주석을 공통 스키마로 변환하여 텍스트, 이미지, 텍스트-이미지 혼합형 타깃을 제공한다. 학습은 혼합 태스크 방식으로 이루어져 한 모델이 구조화된 텍스트 출력과 픽셀 정렬 출력을 동시에 학습하도록 설계되었다. 이로 인해 모델은 단일 디코더 파이프라인으로 여러 유형의 시각 예측을 생성할 수 있게 되었다.

TL;DR

SenseNova-Vision은 텍스트 생성, 이미지 생성, 그리고 텍스트·이미지 혼합 생성이라는 세 가지 출력 공간으로 이질적 시각 태스크를 통일하여 단일 모델로 처리하는 접근을 제시한다. 모델은 자연어 지시와 시각 프롬프트를 입력으로 받아 정규화된 텍스트 레코드나 결정적 인코딩의 이미지형 타깃을 생성하고, 후처리 규칙으로 표준 벤치마크 형식으로 디코딩할 수 있다. 공개된 벤치마크에서 탐지와 깊이, 다중뷰 재구성 등에서 경쟁력 있는 수치를 보고했으나 출력 파싱 규칙과 프롬프트 민감성으로 인한 사용상 제약이 존재한다. 따라서 범용성은 높지만 특정 전문화된 태스크에서 전용 모델보다 낮을 수 있고 실제 배포 전엔 결과 검증 절차가 필요하다. 이 모델은 대규모 통합 코퍼스와 단일 디코더 설계를 통해 2D 구조부터 다중뷰 3D까지 광범위한 시각 문제를 하나의 프레임워크로 다루는 옵션을 제공한다.

핵심 포인트

  • 태스크별 전용 헤드를 사용하지 않고 텍스트, 이미지, 혼합 출력을 통일된 생성 공간으로 재구성한 아키텍처적 접근이 핵심 차별점이다.
  • SenseNova-Vision-Corpus-50M으로 표현된 대규모 지침-응답 형식의 통합 주석 코퍼스를 학습 데이터로 사용하여 다양한 주석 유형을 결정적 규칙으로 통일했다.
  • 출력 결과를 벤치마크 호환 형식으로 디코딩하기 위한 명확한 인코딩 규약을 채택하여 텍스트 레코드와 이미지형 타깃 모두에서 기존 데이터셋과의 호환성을 보장했다.
  • 단일 모델로 2D 구조화 작업부터 밀집 기하 예측, 다중뷰 3D 재구성까지 아우를 수 있도록 설계되어 범용 비전 모델 성격이 강하다.

벤치마크

벤치마크지표비교
Structured Visual Understanding COCO-Com.bbox mAP56.6
Structured Visual Understanding HR/RefCOCOgbbox Accuracies80.2 / 79.6 / 80.5
Dense Geometric Prediction NYUv2AbsRel / δ14.0 / 98.1
Multi-View Reconstruction ETH3DAcc. / Comp. / F10.301 / 0.175 / 72.2
Depth NYUv2 (comparison table)AbsRel4.0MoGe-2 3.5 is lower on AbsRel

이미지 분석

다양한 입력 프롬프트에 대해 SenseNova-Vision이 생성하는 텍스트·이미지·혼합 출력 예시를 한 장으로 압축한 사례 이미지이다.
이 이미지는 동일한 입력 장면에 대해 Visual Prompting, Referring Point, Reasoning Segmentation, Panoptic Segmentation, Object Detection, KeyPoint Detection, OCR, Surface Normal, Interactive Segmentation 등 여러 태스크별 출력이 어떻게 표현되는지를 병렬로 보여준다. 각 패널은 모델이 어떤 출력 스페이스를 선택하는지와 출력의 형태가 텍스트 레이블, 마스크, 컬러 코딩 맵 또는 정규화된 좌표로 변환되는 방식을 시각적으로 전달한다. 이 예시는 통합 생성 프레임워크가 다양한 시각 과제를 단일 모델에서 처리하는 설계 의도를 설명하는 근거 자료 역할을 한다.
SenseNova-Vision의 시스템 구성도와 학습 및 추론 파이프라인을 보여주는 다이어그램이다.
다이어그램은 이미지 및 다중뷰 입력이 어떻게 임베딩되어 텍스트 입력과 결합되고, 단일 디코더가 텍스트형, 이미지형, 혼합형 출력을 생성하는지를 단계별로 나타낸다. 또한 학습 데이터의 통합 스키마와 디코딩 규칙이 출력 디코더와 어떤 인터페이스로 연결되는지를 명시하여 모델 설계와 데이터 파이프라인의 연계를 시각적으로 설명한다. 이 이미지는 기술적 하이라이트와 데이터 전처리, 출력 디코딩 규약의 관계를 이해하는 데 핵심적인 근거를 제공한다.
여러 실제 장면에서 SenseNova-Vision이 생성한 정성적 결과들을 태스크별로 모아 둔 예시 콜라주이다.
이 콜라주는 탐지 박스, 분할 마스크, 깊이 및 노멀 맵, 포인트 맵과 같은 다양한 출력 포맷을 실제 이미지에 적용한 정성적 성능을 보여준다. 패널들을 통해 모델의 출력이 시멘틱 분할부터 기하학적 예측, 다중뷰 재구성까지 일관된 인코딩 규약으로 산출되는 점을 시각적으로 확인할 수 있다. 사용자는 이 이미지를 통해 모델이 다양한 입력 조건에서 생성물의 시각적 품질과 디코딩 가능성을 빠르게 파악할 수 있다.

51

LIKES

544

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.