GVCLab/PersonaLive
Python0 / 0
영상-대-영상 diffusion 기반의 실시간·스트리밍 초상 애니메이션 도구
TL;DR
PersonaLive는 실시간 스트리밍을 염두에 둔 영상-대-영상 diffusion 프레임워크로, reference 이미지 융합과 마이크로-청크 스트리밍 전략으로 무한 길이의 초상 애니메이션을 생성하는 데 초점을 두고 있습니다. README에는 offline/online 추론 스크립트, WebUI 실행 절차(web_start.sh, 포트 7860), TensorRT 변환(torch2trt.py)을 통한 약 2배 가속 옵션과 xFormers 호환성 주의사항이 구체적으로 적혀 있습니다. 학습은 3단계로 구성되어 있으며 8×H100 기준으로 Stage 1~3이 각각 약 13h, 15h, 20h 소요된다고 명시되어 있어 재현에 필요한 계산 자원이 명확합니다. 저장된 pretrained weights와 inference 코드를 통해 데모 및 연구용 실험을 바로 수행할 수 있으나 라이선스가 학술 연구용으로 제한되어 있으므로 사용 목적을 사전에 확인해야 합니다.
핵심 포인트
- 이 레포는 학술용 연구 코드와 실시간·스트리밍 추론용 도구를 모두 포함한 프레임워크 형태로 구성되어 있으며, 학습 코드와 추론(WebUI 포함) 코드가 함께 제공됩니다. pretrained_weights 폴더 구조와 inference_online.py/inference_offline.py, web_start.sh 같은 실행 스크립트가 README에 명확히 나와 있어 즉시 실험해볼 수 있는 출발점이 마련되어 있습니다. 라이선스는 오직 학술 연구용으로 제한되어 있어 상업적 사용이나 민감한 용도에는 제약이 있습니다.
- 실시간 스트리밍 생성은 영상-대-영상(video-to-video) diffusion 파이프라인과 ‘streaming generation’ 전략을 결합해 구현되어 있으며, WebUI에서 reference 이미지 융합(fuse)→Start 순서로 동작합니다. 추론 옵션으로 xFormers, TensorRT, 또는 none을 선택할 수 있고 TensorRT 변환 스크립트(torch2trt.py)를 제공해 성능을 약 2배로 끌어올릴 수 있다는 점이 README에 기술되어 있습니다. RTX 50 시리즈에서는 xFormers 호환성 문제가 있으므로 옵션을 끄는 지침이 포함되어 있어 하드웨어별 예외 처리가 명확합니다.
- 학습 워크플로우는 세 단계(Stage 1~3)로 구분되며, 8×H100 환경에서의 시간 예측이 제공되어 재현 가능성이 높습니다: Stage 1 약 13시간, Stage 2 약 15시간, Stage 3 약 20시간. 데이터 준비용 스크립트(get_boxes.py, extract_meta_info.py)와 Accelerate 설정 지침이 포함되어 있어 multi-GPU 학습 파이프라인을 바로 구성할 수 있습니다. 초기화용 가중치(X-NeMo, pose_guider, stylegan2_discriminator 등) 다운로드 링크가 준비되어 있어 학습 재현에 필요한 외부 자원 경로가 명확합니다.
- 사용성과 제약 사항이 README에 구체적으로 기재되어 있어 실무 적용 시 필요한 사전 검토가 용이합니다. WebUI 가이드(포트 7860, web_start.sh)와 ComfyUI 연동 사례가 있어 프로토타입이나 데모용 배포가 수월하며, TensorRT 변환 시 품질 저하 가능성 및 PyCUDA 빌드 문제 대응법도 안내되어 있습니다. 다만 추론은 가능하지만 전체 파이프라인 재학습이나 대규모 커스터마이징을 위해선 고성능 GPU 자원이 필요하므로 인프라 비용을 사전에 검토해야 합니다.
이미지 분석




3.5k
STARS
494
FORKS
+208
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.