본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
qwen3-vl
Qwen3-VL
Qwen3-VL은 텍스트와 이미지의 멀티모달 정보를 함께 인코딩하는 조건 인코더로, 본 논문에서 텍스트-이미지 입력의 공통 표현을 추출하는 핵심 모듈이다.
비슷한 개념
qwen-image-2-0
multi-modal-model
mmproj
unified-multimodal-model
condition-encoder
modal attention
msrope
t5
← 용어 사전 전체 보기