SDXL VAE를 Flux2VAE로 전환해 텍스처·캐릭터 일관성 개선에 주력한 이미지 생성 베이스
Flux2VAE로 SDXL 계열 VAE를 변환한 베이스 이미지 생성 모델로, 텍스처·패턴 표현과 캐릭터 유사도 개선에 초점을 맞춘 4개 변종을 제공한다.
TL;DR
Mugen은 SDXL 계열의 VAE를 Flux2VAE(Flow 기반) 표현으로 변환하는 것을 목표로 한 베이스 이미지 생성 모델로, NoobAI Flux2VAE v0.3을 기반으로 추가 학습을 거쳐 분기한 결과물이다. 제작진은 잠재공간 변환을 위해 추가로 7 에폭을 학습했으며 전체 변환 비용을 'under $8000'으로 제시하고 애니메·캐릭터 지식을 보존·향상시키는 데 중점을 두었다. 모델은 Flux2VAE 특성상 SD3/Flow 전용 샘플러와의 호환성을 전제로 하며 ComfyUI용 노드와 ReForge 설정을 통해 실제 추론 환경에서 안정적으로 동작하도록 구성되어 있다. 내부적으로는 약 1.2M 이미지로 학습된 판별기를 사용해 1815개 캐릭터에 대한 유사도 벤치마크를 수행했고, 그 결과는 README에 포함된 비교 그래프에서 Mugen의 캐릭터 일관성 향상을 보여준다. 단점으로는 Danbooru 기반 데이터 편향과 Flux2VAE의 'brown bias'가 보고되어 부정적 색조는 음성(negative) 태그로 보정할 필요가 있으며, Flux2VAE 전용 미리보기 제한으로 ReForge의 Approx Cheap 옵션 사용이 권고된다.
핵심 역량
- Flux2VAE 기반의 이미지 생성으로 기존 SDXL VAE에서 어려웠던 세밀한 텍스처와 패턴을 생성할 수 있다
- 단일 트리거(캐릭터 태그)로 생성한 이미지의 캐릭터 유사도를 높이기 위한 튜닝과 벤치마크를 포함한다
- ComfyUI 및 ReForge(Flow 샘플링 지원) 워크플로와 호환되는 추론 구성을 제공한다
- Aesthetic 계열(미세튜닝) 변종으로 품질 우선 출력이나 의견 기반 데이터셋 특화 출력을 선택할 수 있다
강점
- Flux2VAE로의 변환을 통해 SDXL VAE에서 불가능하던 텍스처·패턴 표현을 개선했다는 점이 README에 명시되어 있다
- 캐릭터 일관성 평가는 1815개 표본을 대상으로 내부 판별기(약 1.2M 이미지 학습)를 사용해 수행되어 캐릭터 중심 성능 검증이 구체적으로 이루어졌다
- 공개 라이선스로 배포되어 로컬 커뮤니티에서 베이스 모델처럼 재학습/미세튜닝하기 쉽도록 구성되었다
훈련 방식
CabalResearch/NoobAI-Flux2VAE-RectifiedFlow-0.3을 기점으로 잠재공간 변환(latent space conversion)을 위해 추가로 7 에폭 학습을 수행했고(총 비용 under $8000), 애니메/캐릭터 표현을 보존·향상시키는 데이터 선택에 중점을 두었다.
알아두면 좋은 것
- 라이선스는 fair-ai-public-license-1.0-sd(링크 제공)로 공개 정책이 명시되어 있다
- 모델 본문은 SDXL → Flux2VAE 잠재공간 변환을 위해 추가로 7 에폭 학습을 진행했으며 전체 latent conversion 비용은 'under $8000'으로 기재되어 있다
- 캐릭터 유사도 벤치마크는 내부 판별기(약 1.2M 이미지로 학습)를 사용해 1815개 캐릭터로 수행되었다
- Flux2VAE 관련 실제 추론은 SD3/Flow 전용 샘플러와 ReForge/ComfyUI 노드(공급) 사용을 권장하며, 미리보기는 Approx Cheap 옵션 사용이 필요하다
기술적 특징
- SDXL → Flux2VAE 잠재공간 변환: 기존 NoobAI Flux2VAE v0.3을 기반으로 잠재공간을 Flux2 계열로 변환하는 추가 학습을 수행해 텍스처·패턴 표현이 개선되었다. 이 변환은 'full latent space conversion'을 목표로 하며 README에는 추가 7 에폭 학습과 전체 비용(under $8000)이 명시되어 있다.
- Flow 기반 샘플링 호환성: 모델은 Flux2VAE(Flow) 기반이므로 SD3/Flow 전용 샘플러와 호환되는 추론 경로(ComfyUI 노드, ReForge 등)를 사용하도록 권장된다. README는 샘플러 종류(Euler A, DPM++ SDE 등)와 RF/Comfy 전용 설정을 구체적으로 제시한다.
- 캐릭터 유사도 전용 벤치마크 파이프라인: 생성물의 캐릭터 일관성 평가는 레퍼런스(비생성) 이미지와 AI 생성 이미지를 비교하는 자체 판별기(약 1.2M 이미지로 학습)를 사용해 1815개 캐릭터에 대해 수행되었다. 이 방식은 캐릭터 중심 개선 여부를 정량적으로 추적하기 위함이다.
- 버전별 파생·미세튜닝 분리: 기본 베이스 외에 'Aesthetic' 및 'Aesthetic - Anzhc/Selph' 같은 미세튜닝 변종을 제공해 일반 베이스와 품질 지향 변종을 분리하여 배포했다. 이로 인해 사용자는 원본 베이스와 특정 데이터셋에 특화된 출력 중 선택할 수 있다.
- 커뮤니티 친화적 설계와 인프라: 로컬 커뮤니티가 베이스 모델처럼 재학습할 수 있도록 표준 친화적인 훈련 구성을 유지했고, 학습은 클라우드 8xH100 노드에서 수행되었다고 명시되어 있다.
차별점
- SDXL VAE를 Flux2VAE로 변환한 'latent space conversion'을 명확히 목표로 삼은 베이스 모델
- 캐릭터 유사도 측정을 위해 자체 판별기(약 1.2M 이미지 학습)를 사용한 대규모(1815개) 벤치마크 공개
- Flux2VAE/Flow 전용 추론 워크플로(ComfyUI 노드, ReForge 호환)를 함께 제공하여 실사용성 고려
이미지 분석




84
Likes
2.2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.