본문으로 건너뛰기

Single-Tower Encoder

단일 타워 인코더

이미지와 텍스트를 별도의 인코더에서 처리한 뒤 결합하지 않고, 하나의 Transformer 경로에서 함께 처리하는 구조입니다. NeoMME는 이미지 패치와 텍스트 토큰을 동일한 양방향 Encoder에 입력해 모달리티 간 표현 공간을 공유합니다. 별도 Vision Tower와 Causal Decoder가 필요 없어 모델 크기와 추론 계산량을 줄이는 데 목적이 있습니다.