Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt
이 모델은 비디오-투-비디오 시점 변환과 카메라 앵글 재렌더링을 수행한다. 입력으로 참조 비디오와 정해진 카메라 각도 프롬프트를 받아 장면의 피사체와 내용은 유지한 채 카메라 위치와 시점을 변경한 영상을 생성한다. 추가적으로 소단계 체이닝을 통해 더 큰 시점 이동을 순차적으로 구현할 수 있다.22Bapache-2.0
참조 비디오와 고정 카메라 어휘로 새로운 시점의 영상을 재렌더링하는 LTX-Video 2.3 기반 IC-LoRA 어댑터이다.
학습 방식 · LTX-Video 2.3 (22B)를 기반으로 IC-LoRA 방식으로 어텐션 모듈에 LoRA(rank=16, alpha=16)를 적용해 SynCamVideo의 합성 멀티뷰 데이터 294 쌍으로 학습시켰다.
TL;DR
이 모델은 LTX-Video 2.3(22B)을 기반으로 어텐션 전용 IC-LoRA 어댑터를 학습시켜 참조 비디오와 고정 카메라 각도 어휘를 입력하면 동일 장면을 요청한 새 카메라 시점으로 재렌더링하는 기능을 제공한다. 학습은 SynCamVideo 합성 멀티뷰 데이터의 294개 참조/타깃 쌍으로 진행되었고 LoRA rank=16, alpha=16, bf16, batch size 1 등 실습 친화적 설정으로 훈련되었다. 출력의 예측 가능성은 고정된 63개 카메라 조합 어휘 사용에 기반하며 더 큰 시점 변화는 소단계 체이닝으로 구현하는 것이 권장된다. 주요 제약으로 훈련 카메라가 정면 섹터(약 ±60° azimuth)로 제한되어 뒤쪽 시점에서는 성능 저하가 발생함이 명시되어 있다.
핵심 포인트
- 정확히 정의된 카메라 각도 어휘와 63개 조합으로 학습되어 자유문장 프롬프트보다 예측 가능한 시점 제어를 제공한다. 이 어휘는 azimuth·elevation·distance의 이산 표현으로 구성되어 있고 훈련 데이터의 캡션과 일치시킬 때 모델의 성능이 안정적으로 발현된다. 동의어나 상세한 각도 서술은 학습 범위와 어휘 불일치로 인해 성능 저하를 유발한다.
- 어텐션 모듈(attn1, attn2)의 to_k/q/v/out에만 LoRA를 적용한 점이 눈에 띈다. 이 전략은 시점 변형을 어텐션 가중치 조정 수준에서 집중적으로 처리해 모델의 다른 부분을 건드리지 않으면서도 목적 기능을 실현하게 한다. 따라서 원본 모델 호환성 유지와 경량 배포가 동시에 가능하다.
- 합성 멀티뷰 데이터 기반의 소규모(294쌍) 정교한 학습 쌍을 공개하고 companion dataset을 함께 제공해 재현성과 데이터 투명성을 확보했다. 공개된 데이터와 캡션 목록은 동일한 어휘 사용을 강제하는 실험 설계를 반영하며 연구/개발자가 동일 설정을 재현하는 데 도움을 준다. 이 점은 실무적 재현 가능성 측면에서 차별화 요소이다.
- LoRA 어댑터 형태로 배포되어 원본 대형 모델 가중치를 변경하지 않고도 특정 작업(시점 변경)을 구현할 수 있다. 이 접근은 모델 파일 크기와 통합 복잡도를 낮추며 기존 LTX-Video 워크플로에 플러그인 방식으로 적용이 가능하다. ComfyUI에서 테스트된 워크플로와 예시 파일이 공개되어 실사용 적용성이 높다.
100
LIKES
0
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.