본문으로 건너뛰기

완전 공개 학습 레시피로 구축한 LLaDA-Image

LLaDA-Image는 이미지 전용 사전학습과 TwinFlow distillation으로 생성·편집을 통합하고 2~4단계 추론을 지원합니다.

용어 해설

Diffusion Transformer
이미지의 잠재 표현을 Transformer 블록으로 처리하면서 확산 과정의 각 시점에서 이동 방향을 예측하는 생성 구조입니다. LLaDA-Image에서는 텍스트 조건, 이미지 토큰, 참조 이미지 정보를 하나의 시퀀스로 합쳐 Self-Attention을 수행합니다. 이를 통해 의미 조건이 생성 과정 전체에 직접 반영됩니다.
Flow Matching
잡음에서 실제 데이터로 이동하는 연속적인 경로의 속도장을 학습하는 생성 방법입니다. 학습 중 실제 이미지 잠재 표현과 Gaussian noise를 시점에 따라 보간하고, 모델이 두 상태 사이의 이동 벡터를 맞히도록 최적화합니다. 추론에서는 이 속도장을 따라 잡음을 이미지로 변환합니다.
RMSNorm
활성값의 평균제곱근으로 벡터 크기를 정규화하는 방법으로, 학습 가능한 스케일과 편향 파라미터를 사용하지 않을 수 있습니다. LLaDA-Image는 DiT의 모든 정규화 층에 parameter-free RMSNorm을 적용해 장시간 대규모 학습에서 최적화 안정성을 높였습니다.
Residual Query Adapter
학습 가능한 query token이 텍스트·이미지 입력과 Cross-Attention을 수행해 생성에 필요한 정보를 추출하는 모듈입니다. 추출한 query를 원래 입력에 덧붙인 뒤 frozen VLM에 넣고, 이후 Connector가 VLM 표현을 DiT의 조건 공간으로 변환합니다. 전체 VLM을 Fine-tuning하지 않고 생성 관련 신호를 확보합니다.
TwinFlow
여러 단계의 Flow Matching 생성기를 2~4단계 추론 모델로 압축하는 distillation 방법입니다. 하나의 DiT가 양의 시간에서는 생성기, 음의 시간에서는 fake-score 추정기 역할을 맡고 두 학습 목표를 번갈아 최적화합니다. 추론 때는 생성기 head만 남겨 비용을 줄입니다.
SigLIP-VQ
참조 이미지에서 의미적인 시각 특징을 추출하는 vision encoder입니다. 편집 시 이 특징을 DiT 전용 branch로 변환해 텍스트 편집 지시와 결합하며, 변경하지 않을 영역의 의미와 구조를 유지하는 데 사용됩니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 05.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.