본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

sensenova/SenseNova-U1.5-8B-MoT

텍스트·이미지 이해, 이미지 생성·편집, Infographic 합성까지 처리하는 네이티브 통합 멀티모달 모델8Bapache-2.0

텍스트와 이미지 Patch를 통합해 생성·편집·추론을 처리하는 8B 멀티모달 모델

학습 방식 · NEO-unify 기반 네이티브 통합 멀티모달 모델의 RL 단계 Checkpoint이며, Patchify layer·데이터 품질·Task formulation·Prompt enhancement·Post-training pipeline을 강화했습니다.

TL;DR

SenseNova-U1.5-8B-MoT는 별도 Vision Encoder와 VAE 없이 텍스트 Token과 이미지 Patch를 하나의 NEO-unify 구조에서 처리하는 8B 네이티브 통합 멀티모달 RL Checkpoint입니다. 입력된 Prompt와 이미지 Reference를 통합해 이미지 생성, 4K 출력, Text Rendering, Infographic 합성, 단일·다중 이미지 Editing을 수행하며 Bounding Box와 Visual Marker로 객체·영역 제어도 지원합니다. 공개 차트에서 GenEval 92.2, MMBench (EN) 90.5, LongTextBench (ZH) 98.9, CVTG-2K (NED) 97.8을 기록해 생성·시각 이해·Text Rendering을 함께 평가할 수 있습니다. 다만 긴 혼합 언어 Text, 정밀한 Layout, 작은 인체 세부, 복잡한 다중 Reference Editing에서는 오류와 결과 이탈이 남아 있습니다.

핵심 포인트

  • NEO-unify 구조로 텍스트와 이미지 Patch를 같은 모델 안에서 처리합니다. 별도 VAE나 Vision Encoder 없이 입력을 통합합니다. 생성과 이해를 하나의 흐름으로 연결합니다.
  • 이미지 생성은 구성과 색 조화부터 조명, 재질, 국소 디테일까지 함께 개선합니다. 네이티브 4K 출력과 중국어·영어 Text Rendering을 지원합니다. 포스터와 Infographic처럼 글자가 많은 결과에 맞습니다.
  • Image Editing은 단일 이미지와 다중 Reference를 입력으로 받습니다. 보존할 얼굴, 포즈, 배경, 조명, 구도를 Prompt에 지정할 수 있습니다. 영역 삽입·교체와 객체 수준 제어를 지원합니다.
  • 복잡한 요청에서 객체 수와 공간 관계, Layout, Style, 다중 제약을 함께 처리합니다. Bounding Box와 Visual Marker로 특정 영역을 지정합니다. 다만 작은 얼굴·손과 긴 다국어 Text는 여전히 불안정합니다.

제한사항

  • CFG Scale이 높을 때 일부 Prompt에서 고주파 디테일이나 색상이 과도하게 강조될 수 있습니다. 낮은 cfg_scale로 완화할 수 있지만 결과별 조정이 필요합니다. 과포화와 과도한 디테일이 남을 수 있습니다.
  • 길거나 작은 중국어·영어 혼합 Text가 포함된 이미지에서는 글자 오류가 발생할 수 있습니다. 정확한 객체 수와 정렬, 계층 구조가 필요한 Layout도 완벽하지 않을 수 있습니다. 작은 얼굴과 손, 팔다리의 세부 형태 역시 불안정할 수 있습니다.
  • 넓은 범위의 다중 턴·다중 Reference Editing에서는 보존 대상이 많을수록 결과가 원본에서 벗어날 수 있습니다. 여러 영역을 동시에 유지해야 하는 작업에서 Editing Drift가 발생할 수 있습니다.

벤치마크

벤치마크지표비교
MMLU-Proscore86.7
IFBenchscore69
MMMU-proscore66.5
RealWorldQAscore75.8
MMBench (EN)score90.5
HallusionBenchscore68.5
MathVistascore85.8
GenEvalscore92.2
DPGBenchscore88.1
QwenImageBenchscore60.2*
WISE (w/o think)score70
LongTextBench (EN)score98.8
LongTextBench (ZH)score98.9
CVTG-2K (WA)score94.8
CVTG-2K (NED)score97.8
BizGenEval (Hard)score51.4
BizGenEval (Easy)score70.2
GenBench (Q-acc)score61.9
GenBench (I-acc)score8.2
OpenINGscore9.2
UniMMMU (GEU)score29.3
RealUnify (GEU)score56.3
VBVR-Proscore68.3
ImgEditscore4.6
GEdit-Benchscore8.3
WeEditscore7.5
RISEBenchscore38.6*
OmniRef-Bench (MLLM Evaluation)score8.2

이미지 분석

SenseNova-U1.5가 텍스트와 이미지 Patch를 NEO-unify 기반 단일 구조에서 인코딩·디코딩하는 개념도입니다.
도식은 Word-Emb Encoding과 Patch-Emb Encoding이 같은 SenseNova-U series로 들어가고, 상단에서 Word와 Patch Emb를 각각 디코딩하는 흐름을 담고 있습니다. 왼쪽에는 OCR·VQA·추론·Agentic Decision·Spatial Intelligence가, 오른쪽에는 Image Synthesis·Editing·Infographic Synthesis·통합 추론이 배치되어 이해와 생성을 한 구조로 묶는 방향을 나타냅니다.
SenseNova-U1.5의 이미지 생성·편집·다중 입력 활용 사례를 모은 Showcase 이미지입니다.
상단에는 포스터, 여행 안내도, 음악 행사물처럼 Text와 도형이 많은 생성 결과가 배치되어 있고, 중단에는 사진·잡지 표지·인물 이미지 생성 사례가 이어집니다. 하단에는 산업용 Infographic 편집과 실내 장면 변경, 음식·동물·캐릭터 등 Multiple Inputs를 활용한 결과가 포함되어 모델의 생성 및 Editing 범위를 나타냅니다.
Pure Text, Visual Reasoning, Visual Understanding 영역별 SenseNova-U1.5-8B-MoT 벤치마크 점수를 비교한 방사형 차트입니다.
차트는 General Generation, Text Rendering, Infographics, Visual Reasoning, Visual Understanding, Pure Text를 중심으로 여러 평가 점수를 방사형 막대 형태로 배치합니다. 범례에서 SenseNova-U1.5-8B-MoT가 기준 모델로 표시되며, LongTextBench·CVTG-2K·GenEval·MMBench 등 텍스트 생성과 시각 이해·추론 평가가 함께 포함됩니다.
SenseNova-U1.5-8B-MoT의 텍스트, 시각 이해, 생성, Text Rendering, Infographics, 추론, Editing 벤치마크 상세 비교표입니다.
차트는 MMLU-Pro와 IFBench부터 MMMU-pro, RealWorldQA, GenEval, LongTextBench, BizGenEval, VBVR-Pro, ImgEdit까지 작업별 점수를 막대그래프로 정리합니다. 모델의 공개 수치로 MMBench (EN) 90.5, GenEval 92.2, LongTextBench (ZH) 98.9, CVTG-2K (NED) 97.8 등이 표시되며, 생성·Text Rendering과 시각 이해·Editing을 한 평가판에서 함께 비교합니다.

94

Likes

954

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.