본문으로 건너뛰기

LTX-Video: 시공간 1:192 압축으로 실시간 비디오 생성을 구현한 Latent Diffusion 모델

LTX-Video는 극도로 높은 압축률의 VAE와 DiT 구조를 통해 고품질 비디오의 실시간 생성을 가능하게 한 오픈소스 모델이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LTX-Video는 시공간 정보를 1:192로 압축하는 고효율 Video-VAE와 Transformer 기반 Diffusion 모델을 결합하여 실시간 비디오 생성을 구현했다. H100 GPU 기준 5초 분량의 영상을 단 2초 만에 생성하며, 고주파 디테일을 살리기 위해 Noise Injection과 개선된 GAN Loss를 도입했다. 정성적 평가에서 기존 오픈소스 모델들을 압도하는 성능을 보였으나, 프롬프트 민감도와 장시간 영상 생성에는 일부 한계가 존재한다.

챕터별 상세

00:00

LTX-Video 개요 및 실시간 생성 성능

LTX-Video는 고성능 비디오 생성을 실시간 수준으로 끌어올리는 것을 목표로 개발된 오픈소스 모델이다. H100 GPU 한 장을 기준으로 768x512 해상도, 25FPS의 5초 분량 영상을 단 2초 만에 생성하는 압도적인 속도를 달성했다. 이는 기존 Diffusion 기반 모델들이 동일한 사양에서 분 단위의 시간을 소요하던 것과 대조되는 수치이며, 고효율 압축과 최적화된 추론 구조가 결합된 결과이다. Lightricks에서 개발하여 상용 서비스 수준의 품질과 속도를 동시에 확보했다.
04:15

시공간 1:192 압축을 위한 Video-VAE 구조

비디오 데이터의 방대한 연산량을 줄이기 위해 3D Convolution 기반의 Video-VAE 구조를 채택했다. 공간적으로 32x32, 시간적으로 8프레임을 하나의 잠재 벡터(Latent Vector)로 압축하여 총 1:192라는 매우 높은 압축비를 구현했다. 이러한 고배율 압축은 Transformer 블록에 입력되는 토큰 수를 획기적으로 줄여 전체 계산량을 최소화하는 핵심 기전이다. 인코더는 과거와 현재 정보만 활용하는 Causal 방식과 전체 프레임을 활용하는 Non-causal 방식을 선택적으로 사용할 수 있다.

압축비가 높을수록 모델이 처리해야 할 데이터 양이 줄어들어 생성 속도가 빨라지지만, 복원 시 품질 저하가 발생할 위험이 있다.

09:39

고주파 디테일 복원을 위한 기술적 개선

높은 압축률에서도 영상의 세부 디테일을 유지하기 위해 디코더에 Noise Injection 기법을 도입했다. StyleGAN에서 영감을 얻어 잠재 벡터 외에 미세한 노이즈 성분을 추가 입력함으로써 머리카락이나 피부 질감 같은 고주파 성분을 풍부하게 생성한다. 또한 마지막 Denoising 단계를 픽셀 공간 변환 과정과 통합하여 아티팩트를 줄이고 시각적 일관성을 높였다. 이를 통해 압축 과정에서 손실되기 쉬운 미세한 엣지 성분들을 효과적으로 복원한다.

고주파 성분은 이미지에서 급격한 변화가 일어나는 부분(경계선, 질감 등)을 의미하며, 이를 잘 살려야 영상이 선명하게 보인다.

13:45

복합 로스 함수를 통한 학습 최적화

모델 학습에는 MSE, Wavelet 기반의 DWT Loss, LPIPS, 그리고 개선된 Reconstruction GAN Loss를 복합적으로 사용했다. DWT Loss는 주파수 대역별로 오차를 계산하여 영상의 윤곽선과 세부 구조를 정밀하게 학습하게 한다. 특히 새롭게 제안된 GAN Loss는 Discriminator가 실제 이미지와 재구성된 이미지를 더 엄격하게 구분하도록 설계되어 학습 안정성과 심미적 품질을 동시에 개선했다. 이러한 다각도 로스 설계는 실시간 생성 속도와 고품질 결과물 사이의 균형을 맞추는 역할을 한다.

DWT(Discrete Wavelet Transform)는 신호를 다양한 주파수 성분으로 분해하는 기법으로, 이미지 처리에서 특징 추출에 유용하다.

15:49

DiT 아키텍처와 RoPE의 적용

Diffusion 과정의 백본으로 U-Net 대신 Transformer 구조인 DiT(Diffusion Transformer)를 사용했다. 시간 정보를 반영하기 위해 adaLN-Zero(Adaptive Linear Normalization)를 적용하고, 가변적인 영상 길이에 대응하고자 RoPE(Rotational Positional Embedding)를 도입했다. RoPE는 절대적 위치가 아닌 상대적 위치 관계를 회전 행렬로 학습하여, 학습 시 포함되지 않은 길이의 시퀀스도 품질 저하 없이 유연하게 처리한다. 쿼리와 키 값에 RMSNorm을 적용하여 수치적 안정성도 확보했다.
20:28

데이터 정제 파이프라인 및 성능 평가 결과

고품질 데이터셋 구축을 위해 심미성 평가 모델과 모션 필터링, 자체 개발한 비디오 캡셔너를 포함한 정제 파이프라인을 가동했다. 정성적 평가인 Human Survey 결과, LTX-Video는 OpenSora나 CogVideoX 같은 기존 오픈소스 모델 대비 80~90% 이상의 압도적인 승률(Win Rate)을 기록했다. 시각적 품질, 모션의 충실도, 프롬프트 일치도 모든 면에서 우수한 성능이 확인됐다. 다만 프롬프트 내용에 따른 결과물 편차가 존재하며, 장시간 영상 생성 기능은 향후 과제로 남았다.

Win Rate는 두 모델의 결과물을 사람이 직접 비교하여 어느 쪽이 더 나은지 투표한 비율을 의미한다.

용어 해설

변분 오토인코더(VAE)
입력 데이터를 저차원의 잠재 공간으로 압축하고 다시 복원하는 생성 모델의 일종이다. 데이터를 확률 분포 형태로 인코딩하여 새로운 샘플 생성을 가능하게 하며, LTX-Video에서는 비디오 데이터를 효율적으로 압축하는 핵심 도구로 쓰였다.
잠재 확산 모델(Latent Diffusion)
고차원 픽셀 공간이 아닌 압축된 잠재 공간에서 노이즈를 제거하며 데이터를 생성하는 방식이다. 연산량을 획기적으로 줄이면서도 고품질의 결과물을 얻을 수 있어 실시간 비디오 생성의 기반 기술이 되었다.
디퓨전 트랜스포머(DiT)
기존의 U-Net 구조 대신 Transformer 아키텍처를 Diffusion 모델에 적용한 형태이다. 데이터의 장거리 의존성을 더 잘 파악하고 확장성이 뛰어나 대규모 비디오 생성 모델에서 주로 채택되는 구조이다.
회전 위치 임베딩(RoPE)
데이터의 위치 정보를 회전 행렬을 통해 주입하는 기법이다. 절대적 위치가 아닌 상대적 위치 관계를 학습하게 하여, 학습 시보다 더 긴 시퀀스나 다양한 해상도의 데이터를 유연하게 처리할 수 있게 돕는다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 07.수집 2026. 09. 07.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.