MLLM Encoder
멀티모달 대규모 언어 모델 인코더
텍스트 지시와 영상 또는 이미지 정보를 함께 인코딩해 편집 모델이 의미와 시각적 대상을 연결하도록 만드는 구성 요소다. CoinVE-Edit은 Qwen3-VL-8B를 MLLM encoder로 활용해 영역별 지시 해석을 지원한다.
멀티모달 대규모 언어 모델 인코더
텍스트 지시와 영상 또는 이미지 정보를 함께 인코딩해 편집 모델이 의미와 시각적 대상을 연결하도록 만드는 구성 요소다. CoinVE-Edit은 Qwen3-VL-8B를 MLLM encoder로 활용해 영역별 지시 해석을 지원한다.