Giga-World-1, WAN 기반 Diffusers 1.3B·5B 모델 세트
Diffusers 형식의 WAN 기반 생성 모델을 1.3B·5B 버전으로 stage-1에서 파인튜닝하고 scene LoRA를 함께 제공하는 오픈소스 모델 세트이다.
TL;DR
Giga-World-1은 WAN 계열의 사전 학습 체크포인트를 Diffusers 형식으로 변환해 기반으로 삼고 stage-1에서 1.3B(nano)와 5B(pro)로 파인튜닝한 생성 모델 세트이며 각 변형에 대해 full Diffusers 체크포인트와 장면 특화 scene LoRA를 병행 공개해 전체 모델 로드와 경량 어댑터 적용을 모두 지원한다. 배포 아티팩트는 transformer, VAE, text encoder, image encoder, tokenizer, scheduler, image_processor를 분리해 포함하므로 Diffusers 파이프라인으로 즉시 로드해 추론하거나 개별 구성요소를 교체하는 방식으로 활용할 수 있다. 분산 훈련에서 생성된 ZeRO 체크포인트를 fp32로 복원하는 스크립트와 랜덤 상태를 제공해 훈련 재현성이 확보되어 있으며 stage-2로 distillation을 계획해 향후 경량화된 산출물이 추가될 예정이다.
핵심 역량
- 전체 Diffusers 파이프라인으로 텍스트-투-이미지 또는 관련 생성 파이프라인을 실행할 수 있으며 transformer, VAE, text encoder, image encoder, scheduler와 image_processor 구성을 로드해 샘플을 생성한다.
- 경량화된 scene LoRA 가중치를 적용해 전체 체크포인트를 교체하지 않고 특정 장면·스타일을 빠르게 반영할 수 있으며 safetensors 형식의 LoRA 파일을 inference 시점에 병합하거나 별도 adapter로 로드할 수 있다.
- 분산 훈련에서 생성된 ZeRO 형식 체크포인트를 제공하고 제공된 변환 스크립트를 통해 fp32 단일 체크포인트로 복원해 로컬 추론 환경에 맞게 변환할 수 있다.
강점
- 공개된 전체 Diffusers 체크포인트와 장면 적응용 scene LoRA를 동시에 제공해 사용자가 전체 모델을 배포하거나 경량 LoRA만을 적용하는 두 가지 추론 경로를 선택할 수 있다. 이 구조는 대용량 모델을 바로 배포하기 어려운 환경에서 LoRA만으로도 특정 장면 적응을 적용할 수 있게 해 실제 운영 활용도를 높인다. 또한 Apache-2.0 라이선스 표기로 상업적 활용에 제약이 상대적으로 적다.
- 체크포인트 내부에 transformer, vae, text_encoder, image_encoder, image_processor, scheduler 등 Diffusers 파이프라인 구성요소를 분리하여 포함했기 때문에 파이프라인 재현과 컴포넌트별 교체가 수월하다. 분산 학습 아티팩트와 ZeRO 복원 스크립트를 함께 제공해 대규모 훈련 상태를 재현하거나 로컬 환경으로 변환하는 실무 워크플로를 지원한다. 이러한 배포 형식은 연구·개발에서 복제성(reproducibility)과 재사용성을 개선한다.
훈련 방식
WAN 2.1 1.3B 및 WAN 2.2 5B를 Diffusers 형식으로 변환한 사전 학습 체크포인트를 기반으로 stage-1에서 각각 nano(1.3B)와 pro(5B)로 파인튜닝을 수행했고 scene LoRA를 별도 아티팩트로 추출했으며 stage-2에서는 distillation을 계획하고 있다.
알아두면 좋은 것
- 이 리포지토리는 WAN 2.1 1.3B 및 WAN 2.2 5B를 Diffusers 형식으로 변환한 사전 학습 체크포인트들을 before_stage1에 보관하고, stage1에서 nano(1.3B)와 pro(5B)로 각각 파인튜닝한 산출물을 별도 디렉터리로 제공한다. Stage-1 산출물은 full Diffusers 체크포인트와 scene LoRA 두 형태로 공개되어 사용자가 필요에 따라 전체 모델이나 경량 LoRA를 선택할 수 있다. Stage-2로 distillation을 계획하고 있으나 아직 릴리스는 진행되지 않았다.
- stage1/{nano,pro} 구조는 model_index.json과 transformer, vae, text_encoder, tokenizer, scheduler, image_encoder, image_processor와 같은 구성요소를 명시적으로 분리해 배포하므로 Diffusers 파이프라인으로 바로 로드해 추론 파이프라인을 재현하기 용이하다. scene LoRA 아티팩트는 pytorch_lora_weights.safetensors와 transformer_full/partial 등 다양한 포맷을 함께 제공해 개발자가 적재 방식에 따라 유연하게 활용할 수 있다. 분산 학습 복원을 위한 random_states와 ZeRO 변환 스크립트도 포함되어 대규모 훈련 로그를 재현할 수 있도록 설계되었다.
- 라이선스는 Apache-2.0으로 표기되어 있어 상업적 사용을 포함한 широк한 활용이 허용되며, README 상단에 license: apache-2.0이 명확히 표시되어 있다. 또한 Git LFS와 Hugging Face Hub를 통한 배포 예시를 제공해 모델 다운로드와 재현 절차를 명시적으로 안내한다. 모델은 diffusers 프레임워크를 기준으로 배포되어 다양한 추론 환경에서 표준화된 로딩이 가능하다.
기술적 특징
- 두 종류의 Stage-1 아티팩트를 병행 배포한다는 설계적 선택이 모델 활용도를 높인다. 하나는 full Diffusers-format 체크포인트로 transformer, VAE, text encoder, tokenizer, scheduler, image_encoder와 image_processor를 포함해 파이프라인을 즉시 로드해 추론할 수 있게 구성되어 있고, 다른 하나는 scene LoRA로 주요 가중치의 저순위 보정만을 담아 작은 파일로 특정 장면을 빠르게 적용할 수 있게 한다. 이로 인해 대용량 모델을 직접 배포하기 어려운 환경에서도 장면 특화 적응을 가볍게 적용할 수 있다.
- 체크포인트 구조에서 transformer 디렉터리는 DiT 또는 video transformer와 연계 가능한 가중치 구조를 갖추고 있어 모델이 이미지·비디오 변형 아키텍처를 지원하도록 설계되었다. README에 transformer와 image_encoder가 분리되어 명시된 점은 encoder-decoder 구성이나 encoder-only 변환을 통한 다양한 파이프라인 실험을 용이하게 만든다. 이러한 모듈성은 추후 encoder 교체나 멀티모달 확장 시 장점을 제공한다.
- 분산 훈련 관련 아티팩트와 zero_to_fp32.py 스크립트의 포함은 ZeRO로 분산 저장된 체크포인트를 단일 fp32 포맷으로 복원해 로컬 추론 환경에 적재할 수 있도록 한다. 이 과정은 분산 학습에서 흔히 발생하는 shard 합치기와 dtype 변환을 자동화하여 재현성을 확보한다. 실무적으로는 대규모 모델을 개발자 로컬 또는 소규모 인프라로 옮길 때 핵심적인 단계이다.
- stage 기반 파이프라인을 명시해 개발·배포 흐름을 분리한 점이 특징이다. before_stage1에는 다양한 사전 학습 브랜치를 보관하고 stage1에서는 각 크기별로 파인튜닝을 집중했으며 stage2에서는 지식 증류(distillation)를 통해 경량화·성능 유지 균형을 노리는 로드맵을 제시한다. 이 접근은 초기에는 표현력 높은 큰 모델을 유지하고 이후 단계에서 효율화하는 실무적 분리 전략을 반영한다.
차별점
- full Diffusers 체크포인트와 scene LoRA 아티팩트를 동시에 공개해 전체 모델과 경량 어댑터를 병행 사용할 수 있는 배포 형식을 채택했다.
- WAN 2.1 1.3B와 WAN 2.2 5B 계열의 사전 학습 체크포인트를 기반으로 각각 nano와 pro 변형을 stage-1에서 제공해 모델 크기 선택지를 명확히 했다.
- 분산 체크포인트 복원을 위한 ZeRO 변환 스크립트와 학습 랜덤 상태 파일을 함께 제공해 훈련 재현성과 대규모 체크포인트 관리 편의성을 높였다.
137
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.