용어 해설
- 경량 VAE 토크나이저(Mage-VAE)
- — Mage-VAE는 픽셀-디퓨전 기반의 일회차 인코더·디코더를 사용하여 FLUX.2-VAE의 잠재분포를 앵커로 정규화한 경량화된 이미지 토크나이저이다. 디코더는 합성곱 기반의 한 단계 복원기로 동작하고 인코더는 대칭적으로 픽셀로부터 잠재를 생성하는 한 단계 확산 모델로 구현되어 인코딩과 디코딩 비용을 크게 낮춘다. 이 토크나이저는 16×16 공간 저감과 128 채널 잠재를 생성하여 NR-MMDiT와 직접 호환되는 생성용 잠재 공간을 제공한다.
- 네이티브 해상도 멀티모달 디퓨전 트랜스포머(Native-Resolution MMDiT)
- — Native-Resolution MMDiT는 텍스트와 이미지 잠재를 결합해 패킹된 가변 길이 토큰 시퀀스로 처리하는 4B 규모의 디퓨전 트랜스포머 백본이다. per-sample 2D RoPE와 FlashAttention의 가변 길이 커널을 활용해 해상도 버킷 없이 네이티브 해상도에서 학습하고 추론한다. 이 구조는 다양한 종횡비와 해상도를 하나의 체크포인트로 일반화할 수 있게 한다.
- 정류화 흐름 매칭(Rectified Flow Matching)
- — Rectified flow matching은 잠재 공간에서의 흐름-매칭 기반 목표로서 ODE/확산 기반 샘플링 경로를 직접 모형화해 역과정을 대체하는 학습 규준이다. z_t = (1−t)z + t ε 형태의 노이즈 보간을 사용하고 예측 벡터를 타깃 속도와 맞추어 모델을 학습시킨다. 이 방법은 결정적 ODE 샘플러와 호환되어 저스텝 추론에 유리하다.
- 앵커-잠재 KL 정규화(Anchor-Latent KL)
- — 앵커-잠재 KL은 표준 가우시안 프라이어 대신 고성능 공개 VAE의 잠재 분포를 목표로 posterior를 정규화하는 기법이다. 학습 중 인코더 출력이 앵커 잠재 분포와 가까워지도록 KL 항을 적용해 downstream 디퓨전 학습에 적합한 잠재 지오메트리를 확보한다. 이 방식은 경량 토크나이저가 고품질 생성 잠재를 유지하도록 돕는다.
- 포워드 프로세스 기반 NFT 정렬(Diffusion-NFT)
- — Diffusion-NFT는 흐름-매칭 생성기에서 포워드 프로세스를 직접 활용해 negative-aware fine-tuning을 수행하는 포스트트레이닝 방법이다. 온라인으로 생성 후보를 샘플링해 평가자 보상에 따른 positive/negative 매칭 항을 포함한 보상 가중 손실로 모델을 미세조정한다. 이 방법은 확률밀도 추정이나 특정 샘플러 종속성 없이 생성 품질과 프롬프트 준수도를 개선한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




