용어 해설
- Qwen3-VL
- — Qwen3-VL은 텍스트와 이미지의 멀티모달 정보를 함께 인코딩하는 조건 인코더로, 본 논문에서 텍스트-이미지 입력의 공통 표현을 추출하는 핵심 모듈이다.
- 다중모달 확산 Transformer(Multimodal Diffusion Transformer)
- — 다중 모달 입력을 공동으로 모델링하는 diffusion 기반 백본으로, 텍스트-이미지 토큰의 상호작용을 촉진한다.
- Qwen-Image-2.0
- — 텍스트-이미지 생성과 이미지 편집을 하나의 프레임워크에서 수행하는 이미지 생성 foundation model.
- 고압축 VAE(High-Compression VAE)
- — 16× 해상도 다운샘플링을 활용하는 고압축 VAE로, latent 공간의 역확산 학습을 가능하게 한다.
- MSRoPE
- — 텍스트-이미지 토큰 간 위치 정보를 공동으로 인코딩하는 다중 모달 포지션 인코딩 기법.
- SwiGLU
- — MLP 계층에서 비선형 활성화를 개선하여 joint 텍스트-이미지 학습의 안정성과 표현력을 높이는 비선형 모듈.
- RLHF
- — 다양한 보상 모델을 이용한 강화 학습 기반 인간 피드백 정렬 기법으로, 생성 품질과 조건 준수를 향상시킨다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.