애니메 특화 2B 텍스트→이미지 디퓨전 — Anima의 설계와 사용 팁
2B 파라미터 텍스트→이미지 디퓨전 모델로, 수백만 건의 애니메 이미지와 80만건의 비사진 예술 이미지를 학습해 탄탄한 일러스트·캐릭터 생성 성능을 제공한다.
TL;DR
Anima는 CircleStone Labs와 Comfy Org 협업으로 공개된 2B 파라미터 텍스트→이미지 디퓨전 베이스 모델로, 애니메·일러스트 스타일 생성에 초점을 맞춘다. 모델은 nvidia/Cosmos-Predict2-2B-Text2Image를 기반으로 추가 학습되었고, 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지를 사용해 합성 데이터는 포함하지 않았다. 조건화 방식은 Danbooru 스타일 태그와 자연어 캡션의 혼합을 사용하며 학습 시 태그 드롭아웃을 적용해 불완전한 프롬프트에 대한 내구성을 확보했다. 추론 권장 설정은 512²–1536² 해상도, 30–50 스텝, CFG 4–5이며 여러 샘플러(er_sde, euler_a, dpmpp_2m_sde_gpu)와 Qwen 텍스트 인코더·Qwen-Image VAE 구성을 권장한다. 파인튜닝 관련으로는 LLM adapter를 학습시키지 말라는 경고와 LoRA 학습률(예: rank 32에 2e-5 권장)이 명시돼 있다. 결과적으로 Anima는 애니메·일러스트 생성에서 높은 스타일 충실도와 다양한 태그 제어를 제공하지만 사진실사 표현과 긴 텍스트 렌더링에는 한계가 있다. ComfyUI 네이티브 워크플로우와 비교용 구성 파일을 제공해 실험·비교가 용이하나 라이선스는 비상업적(circlestone-labs-non-commercial-license)으로 사용 제약이 존재한다.
핵심 역량
- 애니메·일러스트 스타일의 캐릭터 및 장면 생성
- Danbooru 스타일 태그와 자연어 캡션을 혼합한 조건화로 디테일 제어
- 512²에서 1536² 해상도 범위에서 안정적 생성
- ComfyUI 워크플로우와 네이티브 호환으로 빠른 실험·비교 구동
- 품질·미적평가 태그(score_X, masterpiece 등)를 지원해 출력 스타일 조정
강점
- 애니메·일러스트 중심의 대규모 실제 이미지 데이터(수백만 건)로 스타일 커버리지가 넓음 — 특정 애니메 태그·아티스트 스타일을 잘 반영함.
- ComfyUI 네이티브 지원과 비교 워크플로(모델 비교용 anima_comparison.json) 제공으로 실무에서 모델 비교·튜닝이 용이함.
- 텍스트 인코더(Qwen 3.06b)와 Qwen-Image VAE를 권장 구성으로 명시해 재현 가능성이 높음.
훈련 방식
nvidia/Cosmos-Predict2-2B-Text2Image 기반으로 텍스트-투-이미지 디퓨전 방식으로 추가 학습했으며, 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지를 사용했고 합성 데이터는 사용하지 않았다.
알아두면 좋은 것
- 학습 데이터는 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지이며, 합성 데이터는 사용하지 않았다.
- 라이선스는 'circlestone-labs-non-commercial-license'로 비상업적 사용 조건이 명시되어 있다 (LICENSE.md 참조).
- 학습 데이터의 컷오프는 2025년 9월이며, 애니메·일러스트 쪽 최신 데이터를 포함한다.
- 파인튜닝 관련 핵심 권고로 'LLM adapter'는 학습시키지 말라고 명시되어 있고, LoRA 학습 시 낮은 learning rate(예: rank 32에 2e-5 권장)를 제시한다.
기술적 특징
- 기반 모델 선택과 목적: 본 모델은 nvidia/Cosmos-Predict2-2B-Text2Image를 기반으로 추가 학습된 2B 파라미터 디퓨전 모델이다. 이 기반 선택은 텍스트-이미지 조건화에 적합한 아키텍처 위에서 애니메·일러스트 특화 개념을 확장하는 목적이다.
- 데이터 구성과 합성 배제: 학습에 사용된 데이터는 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지로 구성되었으며 합성 데이터는 사용하지 않았다. 이는 실제 예술적 스타일과 태그 분포를 모델에 직접 반영해 자연스러운 일러스트 표현을 확보하려는 설계이다.
- 프롬프트·태그 기반 학습과 태그 드롭아웃: Danbooru 스타일 태그, 자연어 캡션, 태그·캡션 혼합을 사용해 조건화를 강화했으며 학습 중 태그 드롭아웃을 적용해 프롬프트 일부가 누락되어도 안정적으로 생성되도록 했다. 이로 인해 다양한 수준의 세부 지시문에서도 일관된 스타일을 유지한다.
- 추론·샘플링 권장 설정: 512²–1536² 해상도에서 30–50 스텝, CFG 4–5를 권장하고 여러 샘플러(er_sde, euler_a, dpmpp_2m_sde_gpu)를 테스트하도록 안내한다. 특정 스케줄러(beta57)는 질감·페인터리한 표현을 개선하는 용도로 제시됐다.
- 실행 환경과 구성요소: ComfyUI 네이티브 워크플로우와 모델 파일 배치(모델·텍스트 인코더·VAE)를 명시해 재현을 쉽게 했고, Qwen 텍스트 인코더·Qwen-Image VAE 사용을 권장해 텍스트-이미지 임베딩 호환성을 확보했다.
차별점
- 애니메·일러스트 특화 데이터셋(수백만 건)으로 기본 베이스 모델을 그대로 확장해 베이스 성능과 다양성 균형을 노림
- Danbooru 태그와 자연어 캡션의 혼합 학습·태그 드롭아웃으로 불완전한 프롬프트에도 견고한 스타일 유지
- ComfyUI용 워크플로우와 비교용 anima_comparison.json을 제공해 다른 모델과의 시각적 비교 실험이 즉시 가능
이미지 분석


1.7k
Likes
763.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.