본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Alissonerdx/LTX-Best-Face-ID

참조 이미지 기반 reference-to-video(정체성 보존 비디오 생성)22Bother

참조 사진 한 장으로 인물 정체성을 유지한 비디오를 생성하는 LTX-2.3 기반 LoRA.

학습 방식 · LTX-2.3(22B) 기반에 LoRA(rank=128, alpha=128)를 적용하고, 오버랩 참조 latent와 TASS-RoPE 조건화, ArcFace 코사인 유사도 보조손실로 OpenS2V·HuMoSet의 참조-비디오 쌍을 학습했다.

TL;DR

LTX-Best-Face-ID는 Lightricks의 LTX-2.3(22B) 텍스트-투-비디오 모델에 rank 128 LoRA를 적용해, 참조 인물 사진 한 장과 프롬프트만으로 그 사람의 정체성을 유지한 비디오를 생성하는 reference-to-video LoRA다. 참조 잠재를 프레임-0 RoPE 그리드에 겹쳐 넣고 소스별로 다른 RoPE 위상을 곱하는 TASS-RoPE로 참조와 생성 프레임을 구분하며, 학습 중에는 디코딩한 얼굴을 ArcFace 임베딩과 비교하는 보조 손실로 정체성 유사도를 끌어올렸다. 근접 정면 얼굴 참조와 신원 속성을 담은 상세 프롬프트를 함께 쓰면 정체성 보존이 강해지고, 최근에는 얼굴·전신 4패널 캐릭터 시트를 참조로 받아 의상·체형까지 일관되게 유지하는 후속 체크포인트도 추가됐다. ComfyUI의 BFS Nodes와 Prompt Enhancer로 워크플로가 통합돼 있어 캐릭터 영상 제작에 바로 적용하기 좋다.

핵심 포인트

  • 오버랩 참조 latent와 소스별 RoPE 위상(TASS-RoPE)으로 참조와 생성 프레임을 명확히 구분해 다중 참조로도 자연스럽게 확장된다.
  • flow-matching 예측을 픽셀로 디코딩한 뒤 ArcFace 임베딩과의 코사인 유사도를 보조 손실로 사용해 얼굴 유사도를 학습 신호로 직접 반영한다.
  • 얼굴 근접 참조 전용 기본 체크포인트에 이어, 얼굴+전신 4패널 캐릭터 시트를 참조로 받아 의상·체형까지 일관되게 유지하는 후속 체크포인트를 함께 제공한다.
  • ComfyUI용 BFS Nodes와 참조 이미지 기반 Prompt Enhancer를 함께 제공해 실사용 파이프라인이 바로 갖춰진다.

제한사항

  • 정체성 정보가 원본 참조 latent에서 오기 때문에 참조 이미지의 외형·액세서리가 첫 프레임에 그대로 '붙여넣기'된 것처럼 보일 수 있다.
  • 프롬프트에 신원 속성이 구체적으로 기술되지 않으면 정체성 보존력이 약해지는 프롬프트 의존성이 크다.
  • 기본 체크포인트는 근접 정면 얼굴 위주 데이터로 학습되어 전신 샷이나 얼굴이 작게 나온 참조에서는 정체성 유지력이 떨어진다.

272

LIKES

0

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.