sensenova/SenseNova-U1.5-8B-MoT
텍스트·이미지 이해, 이미지 생성·편집, Infographic 합성까지 처리하는 네이티브 통합 멀티모달 모델8Bapache-2.0
텍스트와 이미지 Patch를 통합해 생성·편집·추론을 처리하는 8B 멀티모달 모델
학습 방식 · NEO-unify 기반 네이티브 통합 멀티모달 모델의 RL 단계 Checkpoint이며, Patchify layer·데이터 품질·Task formulation·Prompt enhancement·Post-training pipeline을 강화했습니다.
TL;DR
SenseNova-U1.5-8B-MoT는 별도 Vision Encoder와 VAE 없이 텍스트 Token과 이미지 Patch를 하나의 NEO-unify 구조에서 처리하는 8B 네이티브 통합 멀티모달 RL Checkpoint입니다. 입력된 Prompt와 이미지 Reference를 통합해 이미지 생성, 4K 출력, Text Rendering, Infographic 합성, 단일·다중 이미지 Editing을 수행하며 Bounding Box와 Visual Marker로 객체·영역 제어도 지원합니다. 공개 차트에서 GenEval 92.2, MMBench (EN) 90.5, LongTextBench (ZH) 98.9, CVTG-2K (NED) 97.8을 기록해 생성·시각 이해·Text Rendering을 함께 평가할 수 있습니다. 다만 긴 혼합 언어 Text, 정밀한 Layout, 작은 인체 세부, 복잡한 다중 Reference Editing에서는 오류와 결과 이탈이 남아 있습니다.
핵심 포인트
- NEO-unify 구조로 텍스트와 이미지 Patch를 같은 모델 안에서 처리합니다. 별도 VAE나 Vision Encoder 없이 입력을 통합합니다. 생성과 이해를 하나의 흐름으로 연결합니다.
- 이미지 생성은 구성과 색 조화부터 조명, 재질, 국소 디테일까지 함께 개선합니다. 네이티브 4K 출력과 중국어·영어 Text Rendering을 지원합니다. 포스터와 Infographic처럼 글자가 많은 결과에 맞습니다.
- Image Editing은 단일 이미지와 다중 Reference를 입력으로 받습니다. 보존할 얼굴, 포즈, 배경, 조명, 구도를 Prompt에 지정할 수 있습니다. 영역 삽입·교체와 객체 수준 제어를 지원합니다.
- 복잡한 요청에서 객체 수와 공간 관계, Layout, Style, 다중 제약을 함께 처리합니다. Bounding Box와 Visual Marker로 특정 영역을 지정합니다. 다만 작은 얼굴·손과 긴 다국어 Text는 여전히 불안정합니다.
제한사항
- CFG Scale이 높을 때 일부 Prompt에서 고주파 디테일이나 색상이 과도하게 강조될 수 있습니다. 낮은 cfg_scale로 완화할 수 있지만 결과별 조정이 필요합니다. 과포화와 과도한 디테일이 남을 수 있습니다.
- 길거나 작은 중국어·영어 혼합 Text가 포함된 이미지에서는 글자 오류가 발생할 수 있습니다. 정확한 객체 수와 정렬, 계층 구조가 필요한 Layout도 완벽하지 않을 수 있습니다. 작은 얼굴과 손, 팔다리의 세부 형태 역시 불안정할 수 있습니다.
- 넓은 범위의 다중 턴·다중 Reference Editing에서는 보존 대상이 많을수록 결과가 원본에서 벗어날 수 있습니다. 여러 영역을 동시에 유지해야 하는 작업에서 Editing Drift가 발생할 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro | score | 86.7 | — |
| IFBench | score | 69 | — |
| MMMU-pro | score | 66.5 | — |
| RealWorldQA | score | 75.8 | — |
| MMBench (EN) | score | 90.5 | — |
| HallusionBench | score | 68.5 | — |
| MathVista | score | 85.8 | — |
| GenEval | score | 92.2 | — |
| DPGBench | score | 88.1 | — |
| QwenImageBench | score | 60.2* | — |
| WISE (w/o think) | score | 70 | — |
| LongTextBench (EN) | score | 98.8 | — |
| LongTextBench (ZH) | score | 98.9 | — |
| CVTG-2K (WA) | score | 94.8 | — |
| CVTG-2K (NED) | score | 97.8 | — |
| BizGenEval (Hard) | score | 51.4 | — |
| BizGenEval (Easy) | score | 70.2 | — |
| GenBench (Q-acc) | score | 61.9 | — |
| GenBench (I-acc) | score | 8.2 | — |
| OpenING | score | 9.2 | — |
| UniMMMU (GEU) | score | 29.3 | — |
| RealUnify (GEU) | score | 56.3 | — |
| VBVR-Pro | score | 68.3 | — |
| ImgEdit | score | 4.6 | — |
| GEdit-Bench | score | 8.3 | — |
| WeEdit | score | 7.5 | — |
| RISEBench | score | 38.6* | — |
| OmniRef-Bench (MLLM Evaluation) | score | 8.2 | — |
이미지 분석




94
Likes
954
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.