네이티브 해상도 멀티모달 디퓨전 트랜스포머
Native-Resolution MMDiT는 텍스트와 이미지 잠재를 결합해 패킹된 가변 길이 토큰 시퀀스로 처리하는 4B 규모의 디퓨전 트랜스포머 백본이다. per-sample 2D RoPE와 FlashAttention의 가변 길이 커널을 활용해 해상도 버킷 없이 네이티브 해상도에서 학습하고 추론한다. 이 구조는 다양한 종횡비와 해상도를 하나의 체크포인트로 일반화할 수 있게 한다.