본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Lightricks/LTX-2.3-22b-IC-LoRA-Clean-Plate

비디오-투-비디오: 원본 영상의 레퍼런스 latent로 인물·이동 객체를 제거해 동일 길이·프레이밍의 빈 배경 영상 생성(마스크 입력 미지원, 전역 처리)22Bltx-2-community-license

LTX-2.3 22B에 적용된 IC-LoRA로 원본 레퍼런스를 조건으로 삼아 사람과 이동 물체를 제거한 동일 프레이밍의 클린 플레이트를 생성한다.

학습 방식 · LTX-2.3 22B 기반 Video-to-Video IC-LoRA(rank 32, alpha 32)를 reference-latent conditioning과 first_frame_conditioning_p=0.1로 학습했고, AdamW·lr 2e-4(선형 감쇠)·26개 쌍 데이터로 단일 H100에서 약 224분 훈련했다.

TL;DR

이 모델은 LTX-2.3 22B를 기반으로 한 IC-LoRA로서 원본 레퍼런스 영상의 latent를 조건 신호로 활용해 사람과 이동체를 제거한 동일 프레이밍의 클린 플레이트를 생성한다. 학습은 26개의 쌍 데이터와 rank 32, alpha 32 설정의 IC-LoRA로 3000스텝 동안 단일 H100 80GB에서 약 224분 동안 진행되었고 출력은 49 프레임 @25fps 규격을 기준으로 정렬된다. 입력은 공간 치수가 32로 나누어 떨어지고 프레임 수가 8k+1이어야 하며 마스크 입력을 지원하지 않아 피사체가 화면 대부분을 차지하는 장면에서는 성능 한계가 존재한다. ComfyUI 워크플로와 함께 strength=1.0 초기값으로 사용하고 특정 오브젝트 제거를 강화하려면 대상 오브젝트를 긍정·네거티브 프롬프트에 모두 명시해야 한다.

핵심 포인트

  • LTX-2.3 22B의 가중치를 고정한 채 IC-LoRA(rank 32, alpha 32)만 추가 학습해 목표 기능을 적은 파라미터로 확보했다.
  • 레퍼런스 영상의 latent가 조건 신호라 트리거 단어가 없고, 텍스트 프롬프트는 원하는 빈 장면을 서술하는 데만 쓰인다.
  • 마스크 입력이 필요 없는 전프레임 처리 방식으로 VFX 클린 플레이트 워크플로에 바로 연결된다.
  • 26개의 쌍 데이터로 단일 H100에서 약 224분 학습해 적은 자원으로도 특화 기능을 확보했다.

제한사항

  • 마스크 입력을 지원하지 않는 전프레임 처리 방식이라 피사체가 화면 대부분을 차지하는 장면에서는 성능이 떨어진다.
  • 입력 해상도가 32로 나누어 떨어지고 프레임 수가 8k+1 규격을 충족해야 하는 제약이 있다.
  • 특정 오브젝트 제거 효과를 높이려면 해당 오브젝트를 긍정·네거티브 프롬프트 양쪽에 모두 명시해야 한다.

80

LIKES

0

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.