circlestone-labs/Anima
2B 파라미터 텍스트→이미지 디퓨전 모델로, 수백만 건의 애니메 이미지와 80만건의 비사진 예술 이미지를 학습해 탄탄한 일러스트·캐릭터 생성 성능을 제공한다.
학습 방식 · nvidia/Cosmos-Predict2-2B-Text2Image 기반으로 텍스트-투-이미지 디퓨전 방식으로 추가 학습했으며, 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지를 사용했고 합성 데이터는 사용하지 않았다.
TL;DR
Anima는 CircleStone Labs와 Comfy Org 협업으로 공개된 2B 파라미터 텍스트→이미지 디퓨전 베이스 모델로, 애니메·일러스트 스타일 생성에 초점을 맞춘다. 모델은 nvidia/Cosmos-Predict2-2B-Text2Image를 기반으로 추가 학습되었고, 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지를 사용해 합성 데이터는 포함하지 않았다. 조건화 방식은 Danbooru 스타일 태그와 자연어 캡션의 혼합을 사용하며 학습 시 태그 드롭아웃을 적용해 불완전한 프롬프트에 대한 내구성을 확보했다. 추론 권장 설정은 512²–1536² 해상도, 30–50 스텝, CFG 4–5이며 여러 샘플러(er_sde, euler_a, dpmpp_2m_sde_gpu)와 Qwen 텍스트 인코더·Qwen-Image VAE 구성을 권장한다. 파인튜닝 관련으로는 LLM adapter를 학습시키지 말라는 경고와 LoRA 학습률(예: rank 32에 2e-5 권장)이 명시돼 있다. 결과적으로 Anima는 애니메·일러스트 생성에서 높은 스타일 충실도와 다양한 태그 제어를 제공하지만 사진실사 표현과 긴 텍스트 렌더링에는 한계가 있다. ComfyUI 네이티브 워크플로우와 비교용 구성 파일을 제공해 실험·비교가 용이하나 라이선스는 비상업적(circlestone-labs-non-commercial-license)으로 사용 제약이 존재한다.
핵심 포인트
- 애니메·일러스트 특화 데이터셋(수백만 건)으로 기본 베이스 모델을 그대로 확장해 베이스 성능과 다양성 균형을 노림
- Danbooru 태그와 자연어 캡션의 혼합 학습·태그 드롭아웃으로 불완전한 프롬프트에도 견고한 스타일 유지
- ComfyUI용 워크플로우와 비교용 anima_comparison.json을 제공해 다른 모델과의 시각적 비교 실험이 즉시 가능
- 애니메·일러스트 중심의 대규모 실제 이미지 데이터(수백만 건)로 스타일 커버리지가 넓음 — 특정 애니메 태그·아티스트 스타일을 잘 반영함.
이미지 분석


1.7k
LIKES
763.8k
DOWNLOADS
6 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.