lylogummy/Anima-3.8B
이미지 생성 (애니메이션 스타일)3.8B
Qwen3.5 4B 인코더와 52개 블록 DiT를 결합해 복잡한 장면과 다중 캐릭터 제어 능력을 강화한 애니메이션 이미지 생성 모델.
학습 방식 · Anima 2.9B 기반 52개 블록 확장 DiT와 Qwen3.5 4B 크로스 어텐션 어댑터를 결합하고, 자연어/태그 혼합 Booru 데이터셋으로 학습함.
TL;DR
Anima 3.8B는 Qwen3.5 4B 텍스트 인코더와 52개 블록으로 확장된 DiT 아키텍처를 결합한 애니메이션 스타일 이미지 생성 모델이다. 자연어와 태그를 혼합한 프롬프트를 통해 다중 캐릭터의 위치, 상호작용, 텍스트 렌더링을 정밀하게 제어할 수 있도록 설계되었다. 기존 Anima 2.9B의 레이어를 확장하여 복잡한 장면 묘사 능력을 높였으며, ComfyUI 환경에서 어댑터와 함께 사용하여 최적의 성능을 낼 수 있다.
핵심 포인트
- Qwen3.5 4B 텍스트 인코더와 52개 블록의 DiT 아키텍처를 결합하여 프롬프트 이해도와 공간 구성 능력을 대폭 강화함.
- 자연어와 태그를 혼합한 프롬프트를 지원하며, 다중 캐릭터의 위치와 상호작용을 정밀하게 제어할 수 있음.
- 기존 Anima 2.9B 대비 레이어를 확장하여 복잡한 장면 묘사와 텍스트 렌더링 성능을 개선함.
제한사항
- Qwen3.5 4B 인코더 사용으로 인해 기존 모델 대비 VRAM 사용량과 추론 지연 시간이 증가함.
- 복잡한 다중 캐릭터 구성이나 정확한 텍스트 렌더링은 여전히 실패할 가능성이 있음.
- 모델과 어댑터가 반드시 함께 사용되어야 함.
이미지 분석




74
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.