본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

lylogummy/Anima-3.8B

이미지 생성 (애니메이션 스타일)3.8B

Qwen3.5 4B 인코더와 52개 블록 DiT를 결합해 복잡한 장면과 다중 캐릭터 제어 능력을 강화한 애니메이션 이미지 생성 모델.

학습 방식 · Anima 2.9B 기반 52개 블록 확장 DiT와 Qwen3.5 4B 크로스 어텐션 어댑터를 결합하고, 자연어/태그 혼합 Booru 데이터셋으로 학습함.

TL;DR

Anima 3.8B는 Qwen3.5 4B 텍스트 인코더와 52개 블록으로 확장된 DiT 아키텍처를 결합한 애니메이션 스타일 이미지 생성 모델이다. 자연어와 태그를 혼합한 프롬프트를 통해 다중 캐릭터의 위치, 상호작용, 텍스트 렌더링을 정밀하게 제어할 수 있도록 설계되었다. 기존 Anima 2.9B의 레이어를 확장하여 복잡한 장면 묘사 능력을 높였으며, ComfyUI 환경에서 어댑터와 함께 사용하여 최적의 성능을 낼 수 있다.

핵심 포인트

  • Qwen3.5 4B 텍스트 인코더와 52개 블록의 DiT 아키텍처를 결합하여 프롬프트 이해도와 공간 구성 능력을 대폭 강화함.
  • 자연어와 태그를 혼합한 프롬프트를 지원하며, 다중 캐릭터의 위치와 상호작용을 정밀하게 제어할 수 있음.
  • 기존 Anima 2.9B 대비 레이어를 확장하여 복잡한 장면 묘사와 텍스트 렌더링 성능을 개선함.

제한사항

  • Qwen3.5 4B 인코더 사용으로 인해 기존 모델 대비 VRAM 사용량과 추론 지연 시간이 증가함.
  • 복잡한 다중 캐릭터 구성이나 정확한 텍스트 렌더링은 여전히 실패할 가능성이 있음.
  • 모델과 어댑터가 반드시 함께 사용되어야 함.

이미지 분석

다양한 캐릭터와 스타일을 보여주는 콜라주 이미지.
모델의 시각적 표현 능력을 시각화한 콜라주로, 다양한 캐릭터와 스타일을 생성할 수 있음을 보여줌.
프롬프트 준수 및 텍스트 렌더링 성능을 보여주는 그리드 예시.
특정 캐릭터와 텍스트가 포함된 장면을 생성하여 모델의 프롬프트 이해도와 텍스트 렌더링 성능을 검증함.
공간 구성 및 동작 묘사 성능을 보여주는 예시.
거울 방과 같은 복잡한 배경에서의 캐릭터 배치를 시각화하여 공간 구성 능력을 보여줌.
다중 캐릭터 간의 상호작용과 텍스트 통합 성능을 보여주는 예시.
전투 장면과 한자 텍스트 렌더링을 포함하여 다중 캐릭터 상호작용 및 텍스트 통합 성능을 시각화함.

74

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.