본문으로 건너뛰기

MLLM Encoder

멀티모달 대규모 언어 모델 인코더

텍스트 지시와 영상 또는 이미지 정보를 함께 인코딩해 편집 모델이 의미와 시각적 대상을 연결하도록 만드는 구성 요소다. CoinVE-Edit은 Qwen3-VL-8B를 MLLM encoder로 활용해 영역별 지시 해석을 지원한다.