섹션별 상세
기존의 잠재 공간(Latent space) 방식 대신 x-예측(x-prediction) 공식을 사용하여 픽셀 공간에서 직접 학습을 진행했습니다. 패치 크기를 32로 설정하고 병목 레이어를 활용해 시퀀스 길이를 조절함으로써 1024px 고해상도에서도 연산 효율성을 유지했습니다. 이는 구조를 단순화할 뿐만 아니라 기존 컴퓨터 비전의 지각 손실(Perceptual Loss) 함수들을 직접 적용할 수 있는 장점을 제공합니다.
모델의 수렴 속도와 시각적 품질을 높이기 위해 LPIPS와 DINOv2 기반의 지각 손실을 추가했습니다. 또한 DINOv3를 스승(Teacher) 모델로 사용하는 REPA(Representation Alignment) 기법을 8번째 트랜스포머 블록에 적용하여 모델이 더 풍부한 의미적 특징을 학습하도록 유도했습니다. 이러한 보조 손실 함수들은 메인 연산 대비 오버헤드가 적으면서도 품질 향상에 크게 기여했습니다.
토큰 라우팅 기법인 TREAD를 도입하여 토큰의 50%가 중간 트랜스포머 블록을 건너뛰게 함으로써 스텝당 비용을 절감했습니다. 최적화 도구로는 Adam보다 성능이 뛰어난 Muon 옵티마이저를 2D 파라미터에 적용하고 나머지는 Adam을 사용하는 하이브리드 방식을 채택했습니다. 이를 통해 제한된 시간 내에 더 효율적인 가중치 업데이트와 빠른 성능 도달이 가능했습니다.
Flux 및 Midjourney 기반의 합성 데이터셋 약 870만 개를 사용했으며 Gemini 2.5 Flash를 통해 프롬프트를 일관성 있게 재작성(Re-captioning)했습니다. 학습은 먼저 512px 해상도에서 10만 스텝을 진행한 후 1024px에서 2만 스텝을 추가로 파인튜닝하여 세부 묘사를 강화했습니다. 최종 모델은 일부 해부학적 오류가 있을 수 있으나 전반적인 미적 완성도와 프롬프트 이행 능력이 매우 뛰어난 것으로 나타났습니다.
기술
- H200 GPU
- Muon Optimizer
- DINOv3
- LPIPS
- TREAD
- REPA
활용 사례
- 커스텀 텍스트-이미지 모델 학습
- 비용 효율적인 모델 파인튜닝
- 확산 모델 최적화 실험
언급된 리소스
GitHubPRX GitHub Repository
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 04.수집 2026. 03. 04.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.