본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

circlestone-labs/Anima

텍스트-투-이미지 생성(비사진적 일러스트/애니메 스타일 중심), Danbooru 스타일 태그 및 자연어 캡션 기반 조건화2Bcirclestone-labs-non-commercial-license

2B 파라미터 텍스트→이미지 디퓨전 모델로, 수백만 건의 애니메 이미지와 80만건의 비사진 예술 이미지를 학습해 탄탄한 일러스트·캐릭터 생성 성능을 제공한다.

학습 방식 · nvidia/Cosmos-Predict2-2B-Text2Image 기반으로 텍스트-투-이미지 디퓨전 방식으로 추가 학습했으며, 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지를 사용했고 합성 데이터는 사용하지 않았다.

TL;DR

Anima는 CircleStone Labs와 Comfy Org 협업으로 공개된 2B 파라미터 텍스트→이미지 디퓨전 베이스 모델로, 애니메·일러스트 스타일 생성에 초점을 맞춘다. 모델은 nvidia/Cosmos-Predict2-2B-Text2Image를 기반으로 추가 학습되었고, 수백만 건의 애니메 이미지와 약 80만 건의 비애니메 예술 이미지를 사용해 합성 데이터는 포함하지 않았다. 조건화 방식은 Danbooru 스타일 태그와 자연어 캡션의 혼합을 사용하며 학습 시 태그 드롭아웃을 적용해 불완전한 프롬프트에 대한 내구성을 확보했다. 추론 권장 설정은 512²–1536² 해상도, 30–50 스텝, CFG 4–5이며 여러 샘플러(er_sde, euler_a, dpmpp_2m_sde_gpu)와 Qwen 텍스트 인코더·Qwen-Image VAE 구성을 권장한다. 파인튜닝 관련으로는 LLM adapter를 학습시키지 말라는 경고와 LoRA 학습률(예: rank 32에 2e-5 권장)이 명시돼 있다. 결과적으로 Anima는 애니메·일러스트 생성에서 높은 스타일 충실도와 다양한 태그 제어를 제공하지만 사진실사 표현과 긴 텍스트 렌더링에는 한계가 있다. ComfyUI 네이티브 워크플로우와 비교용 구성 파일을 제공해 실험·비교가 용이하나 라이선스는 비상업적(circlestone-labs-non-commercial-license)으로 사용 제약이 존재한다.

핵심 포인트

  • 애니메·일러스트 특화 데이터셋(수백만 건)으로 기본 베이스 모델을 그대로 확장해 베이스 성능과 다양성 균형을 노림
  • Danbooru 태그와 자연어 캡션의 혼합 학습·태그 드롭아웃으로 불완전한 프롬프트에도 견고한 스타일 유지
  • ComfyUI용 워크플로우와 비교용 anima_comparison.json을 제공해 다른 모델과의 시각적 비교 실험이 즉시 가능
  • 애니메·일러스트 중심의 대규모 실제 이미지 데이터(수백만 건)로 스타일 커버리지가 넓음 — 특정 애니메 태그·아티스트 스타일을 잘 반영함.

이미지 분석

모델 출력 샘플을 모아둔 콜라주 — 다양한 캐릭터 포즈·구도·스타일이 포함됨
콜라주는 Anima가 생성할 수 있는 스타일 스펙트럼을 시각적으로 보여준다. 여러 장의 캐릭터 샘플과 배경 처리, 색감·선화 스타일 차이가 관찰되어 README의 '애니메 중심, 비사진적' 성향과 대규모 애니메 데이터 학습 주장이 시각적으로 뒷받침된다. 일부 이미지는 선이 뚜렷하고 평평한 색채를 보이며, 이는 README에서 권장하는 er_sde·euler_a 계열 샘플러의 특성과 일치한다.
단일 인물 일러스트 예시 — 모델의 대표적 출력(중앙 인물이 'ANIMA' 표지판을 든 이미지)
단일 포트레이트 예시는 모델이 인물 묘사·배경 처리·단어 한두 개(예: 'ANIMA')를 텍스트로 표현하는 데 비교적 안정적임을 보여준다. README의 '짧은 단어는 잘 처리하지만 긴 텍스트 렌더링은 약함'이라는 제한과 일치하며, 고해상도·선화가 깨끗한 점은 권장 해상도(512–1536) 및 샘플러 조합으로 얻을 수 있는 결과임을 시사한다.

1.7k

LIKES

763.8k

DOWNLOADS

6 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.