본문으로 건너뛰기

LeVJEPA: 휴리스틱 없는 효율적이고 확장 가능한 비디오 사전 학습

LeVJEPA는 SIGReg 정규화와 고효율 토큰 마스킹을 통해 기존 모델 대비 연산량을 획기적으로 줄이면서도 강력한 비디오 표현 학습 성능을 구현했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LeVJEPA는 기존 비디오 사전 학습의 복잡한 구조와 높은 연산 비용 문제를 해결하기 위해 제안된 새로운 비디오 인코더이다. SIGReg 정규화를 통해 EMA나 교사-학생 구조 없이 단일 인코더만으로 모델 붕괴를 방지하며, 95%의 높은 토큰 마스킹 비율을 적용해 학습 효율을 극대화했다. 벤치마크 결과 V-JEPA 2 대비 연산량을 최대 20.8배 줄이면서도 동등 이상의 성능을 냈고, 움직임 감지 능력은 이미지 모델인 DINOv2의 두 배에 달한다. 특히 실시간 처리가 가능한 구조 덕분에 로보틱스와 의료 영상 등 다양한 실무 분야로의 확장이 기대된다.

챕터별 상세

00:00

비디오 사전 학습의 한계와 새로운 접근법

기존의 비디오 자가 지도 학습은 픽셀 재구성 방식(MAE)이나 복잡한 교사-학생 구조(EMA)에 의존하여 연산 비용이 매우 높았다. 픽셀 재구성은 노이즈나 배경 같은 불필요한 정보 학습에 모델 용량을 낭비하는 문제가 있었고, EMA 방식은 하이퍼파라미터 튜닝이 까다롭고 불안정했다. LeVJEPA는 이러한 휴리스틱을 제거하고 단일 인코더와 정규화 손실 함수만으로 효율적인 비디오 표현 학습을 구현했다. 이를 통해 비디오 데이터의 시간적 구조를 더 적은 비용으로 학습할 수 있는 기반을 마련했다.

MAE(Masked Autoencoder)는 데이터의 일부를 가리고 원본 픽셀을 복구하며 학습하는 방식이며, EMA(Exponential Moving Average)는 학습 안정성을 위해 가중치의 이동 평균을 사용하는 기법이다.

15:34

LeVJEPA의 핵심 아키텍처와 SIGReg

LeVJEPA는 단일 인코더 구조를 채택하고 SIGReg(Sketched Isotropic Gaussian Regularization)를 도입하여 모델 붕괴를 방지했다. SIGReg는 잠재 임베딩 분포를 등방성 가우시안 분포로 투영하여 모든 데이터가 하나의 점으로 수렴하는 현상을 수학적으로 막는다. 글로벌 뷰와 로컬 뷰 사이의 불변성 손실(Invariance Loss)을 정규화와 결합하여 EMA나 복잡한 예측기 없이도 안정적인 학습이 가능해졌다. 이 구조는 아키텍처 비대칭성을 제거하여 모델 설계를 단순화하고 연산 효율을 획기적으로 높였다.

모델 붕괴(Collapse)는 자가 지도 학습에서 네트워크가 모든 입력에 대해 동일한 출력을 내놓아 학습이 무의미해지는 현상을 말한다.

29:12

토큰 드롭과 블록 인과적 어텐션의 효율성

비디오 데이터의 높은 중복성을 활용하여 최대 95%의 토큰을 무작위로 제거하는 토큰 드롭 전략을 적용했다. 관찰하는 토큰 수를 대폭 줄임으로써 학습 속도를 높이는 동시에 하위 작업에서의 정확도까지 향상시키는 결과를 얻었다. 또한 Block-causal Attention을 도입하여 각 프레임이 미래 프레임을 보지 못하도록 제한함으로써 시간적 순서를 모델에 내재화했다. 이는 추론 시 KV 캐싱을 가능하게 하여 실시간 비디오 처리 및 로보틱스 응용 분야에서의 활용성을 극대화했다.

KV 캐싱은 이전 계산 결과를 저장해 두었다가 재사용하여 추론 속도를 높이는 기술이다.

41:10

성능 벤치마크 및 연산 효율성 비교

LeVJEPA는 동일한 데이터와 에포크 조건에서 V-JEPA 2 대비 연산량을 5.6배에서 최대 20.8배까지 절감하면서도 동등 이상의 성능을 기록했다. ImageNet-1K 벤치마크에서는 동일 연산량 기준 기존 비디오 베이스라인보다 7.6포인트 높은 정확도를 보였다. 이미지 사전 학습 모델인 DINOv2와 비교했을 때, 외형 중심 평가에서는 비슷한 수준을 유지하면서 움직임 중심 평가 정확도는 거의 두 배에 달했다. 이는 비디오가 범용 시각 사전 학습을 위한 매우 효율적이고 우수한 데이터 소스임을 입증한 결과이다.

ImageNet-1K는 이미지 분류 성능을 측정하는 대표적인 벤치마크 데이터셋이다.

54:20

의료 영상 및 로보틱스 적용과 Q&A

발표 후 이어진 질의응답에서는 3D CT나 MRI 같은 의료 영상 데이터에 대한 적용 가능성이 논의되었다. 시간적 순서가 중요한 의료 슬라이스 데이터에서도 Block-causal Attention이 유효할 수 있으며, 특히 소비자용 GPU(RTX 3080 등)에서도 12시간 내에 학습이 가능할 만큼 가볍다는 점이 강조되었다. 로보틱스 분야에서는 실시간 추론 능력이 핵심인데, LeVJEPA의 단일 인코더와 캐싱 구조가 이에 적합하다는 분석이 나왔다. 향후 더 큰 규모의 데이터셋과 모델 크기 확장을 통해 성능 한계를 시험할 계획이다.

3D CT/MRI 데이터는 비디오 프레임과 유사하게 연속적인 슬라이스 구조를 가지고 있어 비디오 모델의 적용이 용이하다.

용어 해설

공동 임베딩 예측 아키텍처(JEPA)
입력 데이터의 일부를 가리고 나머지 부분으로부터 가려진 부분의 잠재 표현(Embedding)을 예측하도록 학습하는 자가 지도 학습 아키텍처이다. 픽셀을 직접 재구성하는 대신 추상화된 특징 공간에서 예측을 수행하므로 배경 노이즈에 덜 민감하고 고차원적인 의미 정보를 더 잘 학습한다.
SIGReg 정규화(SIGReg)
잠재 임베딩 분포를 등방성 가우시안 분포로 유도하여 모델 붕괴(Collapse)를 방지하는 정규화 기법이다. 복잡한 교사-학생 구조나 EMA 없이도 단일 네트워크가 유의미한 표현을 학습하도록 강제하며, 수학적으로 붕괴 방지를 보장한다.
블록 인과적 어텐션(Block-causal Attention)
어텐션 메커니즘에서 현재 프레임이 미래 프레임을 참조하지 못하도록 제한하는 방식이다. 비디오 데이터의 시간적 순서를 모델 구조 자체에 내재화하며, 추론 시 KV 캐싱을 가능하게 하여 실시간 비디오 처리 효율을 높인다.
자가 지도 학습(Self-Supervised Learning)
데이터 자체에서 레이블을 생성하여 학습하는 방법론이다. 비디오 프레임의 일부를 마스킹하고 이를 예측하는 과정을 통해 방대한 양의 레이블 없는 데이터를 학습에 활용할 수 있게 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 12.수집 2026. 09. 12.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.