본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

CabalResearch/Mugen

이미지 생성(Flow 기반 VAE 변환을 적용한 Stable Diffusion 계열 — 특히 애니메·캐릭터 표현과 텍스처·패턴 개선)fair-ai-public-license-1.0-sd

Flux2VAE로 SDXL 계열 VAE를 변환한 베이스 이미지 생성 모델로, 텍스처·패턴 표현과 캐릭터 유사도 개선에 초점을 맞춘 4개 변종을 제공한다.

학습 방식 · CabalResearch/NoobAI-Flux2VAE-RectifiedFlow-0.3을 기점으로 잠재공간 변환(latent space conversion)을 위해 추가로 7 에폭 학습을 수행했고(총 비용 under $8000), 애니메/캐릭터 표현을 보존·향상시키는 데이터 선택에 중점을 두었다.

TL;DR

Mugen은 SDXL 계열의 VAE를 Flux2VAE(Flow 기반) 표현으로 변환하는 것을 목표로 한 베이스 이미지 생성 모델로, NoobAI Flux2VAE v0.3을 기반으로 추가 학습을 거쳐 분기한 결과물이다. 제작진은 잠재공간 변환을 위해 추가로 7 에폭을 학습했으며 전체 변환 비용을 'under $8000'으로 제시하고 애니메·캐릭터 지식을 보존·향상시키는 데 중점을 두었다. 모델은 Flux2VAE 특성상 SD3/Flow 전용 샘플러와의 호환성을 전제로 하며 ComfyUI용 노드와 ReForge 설정을 통해 실제 추론 환경에서 안정적으로 동작하도록 구성되어 있다. 내부적으로는 약 1.2M 이미지로 학습된 판별기를 사용해 1815개 캐릭터에 대한 유사도 벤치마크를 수행했고, 그 결과는 README에 포함된 비교 그래프에서 Mugen의 캐릭터 일관성 향상을 보여준다. 단점으로는 Danbooru 기반 데이터 편향과 Flux2VAE의 'brown bias'가 보고되어 부정적 색조는 음성(negative) 태그로 보정할 필요가 있으며, Flux2VAE 전용 미리보기 제한으로 ReForge의 Approx Cheap 옵션 사용이 권고된다.

핵심 포인트

  • SDXL VAE를 Flux2VAE로 변환한 'latent space conversion'을 명확히 목표로 삼은 베이스 모델
  • 캐릭터 유사도 측정을 위해 자체 판별기(약 1.2M 이미지 학습)를 사용한 대규모(1815개) 벤치마크 공개
  • Flux2VAE/Flow 전용 추론 워크플로(ComfyUI 노드, ReForge 호환)를 함께 제공하여 실사용성 고려
  • Flux2VAE로의 변환을 통해 SDXL VAE에서 불가능하던 텍스처·패턴 표현을 개선했다는 점이 README에 명시되어 있다

이미지 분석

커버 이미지(모델 샘플 콜라주) — 중앙에 'Mugen' 로고가 있고 다양한 출력 예시의 타일 구성이 보임
모델의 대표 출력 모음으로 보이며 애니메·캐릭터 중심 이미지와 다양한 텍스처·패턴 사례가 포함되어 있다. 샘플 구성이 모델이 텍스처·패턴 표현 개선을 목표로 했다는 README 문구와 일치한다. 홍보용 커버이지만 출력 특성(조명, 패턴, 캐릭터 스타일)이 실제 모델 성능 특성을 시각적으로 반영한다.
Character Similarity Benchmark 대시보드 그래프 — Mugen(청록)과 Chenkin(주황) 비교 플롯들이 여러 카테고리로 나열되어 있음
여러 게임·시리즈(예: arknights, azur lane 등)별로 캐릭터 유사도 분포를 비교한 그래프가 포함되어 있어, README의 '1815 캐릭터 벤치마크' 주장을 시각적으로 뒷받침한다. 전반적으로 Mugen(청록)이 Chenkin 대비 높은 누적 유사도를 보이는 구간이 존재하며, 이 비교는 캐릭터 지식 지표로 해석된다. 각 서브플롯의 x축은 샘플 인덱스, y축은 유사도 스코어로 보인다.
단일 컬럼으로 정렬된 생성 샘플 스택 — 다양한 예시를 세로로 나열한 이미지
단일 캐릭터·콘셉트별 다양한 출력 변형을 세로로 나열한 것으로 보이며, 모델의 일관성·다양성 수준을 평가하는 데 유용하다. 특히 얼굴·의상·조명 변이와 텍스처 디테일이 관찰되어 Flux2VAE 전환이 세부 표현에 영향을 미쳤다는 README 주장의 시각적 근거로 활용 가능하다.
이미지 월(여러 생성 출력 타일) — 다양한 스타일·장면의 출력 샘플
다수의 출력 샘플을 모아둔 갤러리로, 패턴·텍스처·컬러링 차이를 한눈에 확인할 수 있다. 일부 샘플에서 높은 세부 디테일과 복잡한 패턴이 관찰되어 Flux2VAE 변환의 효과를 시사한다. 또한 README의 '이미지 모음 다운로드 가능' 문구와 일치하는 참고 자료 역할을 한다.

84

LIKES

2.2k

DOWNLOADS

2 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.