CabalResearch/Mugen
Flux2VAE로 SDXL 계열 VAE를 변환한 베이스 이미지 생성 모델로, 텍스처·패턴 표현과 캐릭터 유사도 개선에 초점을 맞춘 4개 변종을 제공한다.
학습 방식 · CabalResearch/NoobAI-Flux2VAE-RectifiedFlow-0.3을 기점으로 잠재공간 변환(latent space conversion)을 위해 추가로 7 에폭 학습을 수행했고(총 비용 under $8000), 애니메/캐릭터 표현을 보존·향상시키는 데이터 선택에 중점을 두었다.
TL;DR
Mugen은 SDXL 계열의 VAE를 Flux2VAE(Flow 기반) 표현으로 변환하는 것을 목표로 한 베이스 이미지 생성 모델로, NoobAI Flux2VAE v0.3을 기반으로 추가 학습을 거쳐 분기한 결과물이다. 제작진은 잠재공간 변환을 위해 추가로 7 에폭을 학습했으며 전체 변환 비용을 'under $8000'으로 제시하고 애니메·캐릭터 지식을 보존·향상시키는 데 중점을 두었다. 모델은 Flux2VAE 특성상 SD3/Flow 전용 샘플러와의 호환성을 전제로 하며 ComfyUI용 노드와 ReForge 설정을 통해 실제 추론 환경에서 안정적으로 동작하도록 구성되어 있다. 내부적으로는 약 1.2M 이미지로 학습된 판별기를 사용해 1815개 캐릭터에 대한 유사도 벤치마크를 수행했고, 그 결과는 README에 포함된 비교 그래프에서 Mugen의 캐릭터 일관성 향상을 보여준다. 단점으로는 Danbooru 기반 데이터 편향과 Flux2VAE의 'brown bias'가 보고되어 부정적 색조는 음성(negative) 태그로 보정할 필요가 있으며, Flux2VAE 전용 미리보기 제한으로 ReForge의 Approx Cheap 옵션 사용이 권고된다.
핵심 포인트
- SDXL VAE를 Flux2VAE로 변환한 'latent space conversion'을 명확히 목표로 삼은 베이스 모델
- 캐릭터 유사도 측정을 위해 자체 판별기(약 1.2M 이미지 학습)를 사용한 대규모(1815개) 벤치마크 공개
- Flux2VAE/Flow 전용 추론 워크플로(ComfyUI 노드, ReForge 호환)를 함께 제공하여 실사용성 고려
- Flux2VAE로의 변환을 통해 SDXL VAE에서 불가능하던 텍스처·패턴 표현을 개선했다는 점이 README에 명시되어 있다
이미지 분석




84
LIKES
2.2k
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.