본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Lightricks/LTX-2.5

텍스트·이미지·비디오 입력을 바탕으로 동기화된 영상과 음향을 생성하는 멀티모달 생성 모델22B DiT, Gemma 4 12B text encoderLTX-2.x Community License Agreement

텍스트·이미지·비디오에서 멀티샷 영상과 동기화된 음향을 생성하는 22B open-weight 모델

TL;DR

LTX-2.5는 기존 모델을 단순히 미세 조정한 버전이 아니라, 22B DiT full/dev 모델과 distilled checkpoint를 함께 제공하는 open-weight 멀티모달 world model입니다. 텍스트·이미지·비디오를 입력받아 영상과 음향을 동기화하고, native multishot generation으로 장면 전환 뒤에도 인물·환경·조명·음향·스타일을 유지합니다. Gemma 4 12B text encoder가 복잡한 프롬프트를 보존하며, diffusion video decoder와 장면 복잡도에 따른 연산 배분이 세부 묘사와 움직임 품질을 높입니다. Distilled 경로는 고정 8단계와 CFG=1로 동작하고 선택적 duration head가 프롬프트에서 영상 길이를 정하므로, ComfyUI·Python·Diffusers 기반의 로컬 영상 생성과 Fine-tuning에 적합합니다.

핵심 포인트

  • 단일 장면을 넘어 캐릭터·환경·조명·음향을 유지하는 멀티샷 영상을 한 번에 생성합니다.
  • 22B DiT와 Gemma 4 12B text encoder가 복잡한 인물·카메라·조명 조건을 함께 처리합니다.
  • Diffusion video decoder가 VAE 재구성 단계를 대체해 얼굴·질감·문자와 움직임 품질을 높입니다.
  • Distilled checkpoint는 고품질 모델의 프롬프트 준수와 모션 일관성을 유지하면서 8단계로 생성합니다.

제한사항

  • 사실 정보를 제공하는 용도의 모델이 아니며, 입력된 텍스트·이미지·비디오를 바탕으로 통계적으로 콘텐츠를 생성합니다. 따라서 생성 결과를 사실 확인이나 지식 검색의 근거로 사용할 수 없습니다. 영상 생성과 음향 합성 자체에 초점을 둔 모델입니다.
  • 프롬프트 스타일에 따라 결과가 크게 달라지고, 요청한 장면과 완전히 일치하지 않을 수 있습니다. 복잡한 프롬프트는 Gemma 4 12B text encoder와 prompt enhancer가 처리하지만 모든 세부 조건의 보존을 보장하지는 않습니다. 실제 사용에서는 구체적인 프롬프트와 결과 검증이 필요합니다.
  • 체크포인트가 기존 사회적 편견을 증폭하거나 부적절하고 공격적인 콘텐츠를 생성할 수 있습니다. 이는 입력 조건을 통계적 패턴으로 변환하는 생성 방식과 관련된 위험입니다. 배포 환경에서는 출력 필터링과 사용 정책을 별도로 마련해야 합니다.

173

Likes

39

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.