Lightricks/LTX-2.3-22b-IC-LoRA-Ingredients
LTX-2.3 22B에 적용된 IC-LoRA로, 단일 레퍼런스 시트를 루핑해 입력으로 사용해 생성된 비디오에서 캐릭터·소품·세트의 시각적 일관성을 유지한다.
학습 방식 · LTX-2.3-22B를 기반으로 DiT Transformer의 attn/ff 계층에 IC-LoRA(rank=128, alpha=128, dropout=0.0)를 적용해 reference latents에 대해 video_to_video 방식으로 학습했고 bf16, AdamW-8bit, gradient checkpointing을 사용해 12,000 스텝까지 훈련했다.
TL;DR
이 모델은 LTX-2.3-22B 기반에 IC-LoRA를 적용해 단일 레퍼런스 시트를 조건으로 비디오를 생성하도록 설계된 video-to-video 제어용 LoRA다. 레퍼런스 시트는 캐릭터·소품·세트의 패널을 한 이미지에 모은 뒤 정적 비디오로 루핑해 입력으로 제공되며, 모델은 이 입력의 잠재 표현(reference latents)을 읽어 외형을 고정한 채 새로운 동작을 렌더링한다. 학습은 DiT Transformer의 주요 투사(q/k/v/out)와 FF 계층에 rank=128, alpha=128 LoRA를 적용하는 방식으로 이루어졌고 bf16, AdamW-8bit, gradient checkpointing을 사용해 12,000스텝까지 진행되었다. 훈련은 단일 버킷(768×448, 121프레임, 24fps)에서 이루어졌고 추론 권장값으로 LoRA strength 1.4, 30 스텝, guidance scale 4.0과 STG(mode `stg_v`, block 29, scale 1.0)을 제시한다. 결과적으로 이 구성은 주어진 레퍼런스의 시각적 정체성을 높은 일관성으로 유지하는 생성에 유리하나, 단일 해상도·길이 버킷에 특화되어 있어 다른 해상도나 훨씬 긴 클립, 레퍼런스 없는 사용은 분포 외(번역: OOD)에 해당해 결과 품질이 떨어질 가능성이 크다. 또한 데이터는 사유 데이터셋으로 훈련되어 외부 재현성이 제한된다.
핵심 포인트
- Reference-sheet conditioning: 단일 합성 이미지(패널별 캐릭터·소품·세트)를 정적 비디오로 루핑해 입력으로 사용함으로써 생성물의 시각적 정체성을 직접 제어한다.
- IC-LoRA 방식: 전체 가중치를 바꾸지 않고 DiT Transformer의 핵심 투사·FF 계층에 LoRA를 적용해 레퍼런스 정보를 컨텍스트로 통합한다.
- 훈련 분포 고정: 특정 해상도(768×448)와 길이(≥121프레임), 24fps 버킷에서 전용으로 학습되어 해당 조건에서 예측 가능한 품질을 보장한다.
- 레퍼런스-레벨 처리: 레퍼런스 다운스케일 팩터 1과 reference latents에 대한 video_to_video 훈련 전략으로 입력과 출력의 공간적 일치를 유지한다.
71
LIKES
0
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.