본문으로 건너뛰기

Qwen-Image-2.0 기술 보고서

Qwen-Image-2.0은 텍스트-이미지 생성과 이미지 편집을 단일 프레임워크에서 수행할 수 있게 한다. 1K 토큰의 장-context 텍스트 렌더링, 다국어 타이포그래피, native 2K 해상도 포토리얼리즘, 그리고 RLHF 기반의 지시 추종 능력을 갖춰 실무 창작 파이프라인의 효율성과 품질을 크게 향상시킨다. 기존 시스템은 텍스트 렌더링, 고해상도 이미지, 편집 기능을 하나의 모델에서 동시에 달성하기 어려웠다.

용어 해설

Qwen3-VL
Qwen3-VL은 텍스트와 이미지의 멀티모달 정보를 함께 인코딩하는 조건 인코더로, 본 논문에서 텍스트-이미지 입력의 공통 표현을 추출하는 핵심 모듈이다.
다중모달 확산 Transformer(Multimodal Diffusion Transformer)
다중 모달 입력을 공동으로 모델링하는 diffusion 기반 백본으로, 텍스트-이미지 토큰의 상호작용을 촉진한다.
Qwen-Image-2.0
텍스트-이미지 생성과 이미지 편집을 하나의 프레임워크에서 수행하는 이미지 생성 foundation model.
고압축 VAE(High-Compression VAE)
16× 해상도 다운샘플링을 활용하는 고압축 VAE로, latent 공간의 역확산 학습을 가능하게 한다.
MSRoPE
텍스트-이미지 토큰 간 위치 정보를 공동으로 인코딩하는 다중 모달 포지션 인코딩 기법.
SwiGLU
MLP 계층에서 비선형 활성화를 개선하여 joint 텍스트-이미지 학습의 안정성과 표현력을 높이는 비선형 모듈.
RLHF
다양한 보상 모델을 이용한 강화 학습 기반 인간 피드백 정렬 기법으로, 생성 품질과 조건 준수를 향상시킨다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 11.수집 2026. 05. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.