왜 중요한가
자기지도 학습에서 잠재 공간 예측은 픽셀 재구성 대비 학습 효율과 의미적 초점을 제공한다. 그러나 학생 네트워크 구조가 JEPA 성능에 미치는 영향은 충분히 규명되지 않았다. 본 연구는 시암스 학생 인코더가 JEPA에 규제적 바이어스를 부여하여 학습 초기에 수렴을 가속하고 최종적인 선형 분류 성능을 개선함이 확인되었다.
핵심 기여
시암스 학생 인코더를 통합한 SiamJEPA 아키텍처 도입
본문은 두 개의 독립적으로 마스킹된 학생 분기를 가진 SiamJEPA 구조를 구성했다. 구성된 모델은 EMA 기반 교사 네트워크와 결합되어 잠재 예측 손실과 KL 정합 손실을 동시에 최적화했다. 이 아키텍처는 기존 단일 인코더 JEPA를 규제 항으로 일반화할 수 있는 연속적 제어 매개변수를 포함한다.
시암스 인코더가 규제자 역할을 함을 실험적으로 확인
다양한 λ_KL 설정과 프리비트 값을 통해 시암스 분기 간 KL 항이 표현 정렬과 수렴 거동에 미치는 영향을 평가했다. 높은 KL 가중치는 분기 간 일치도를 빠르게 낮추어 초기 에폭에서의 성능 향상을 유도했다. 이러한 관찰은 시암스 구조가 JEPA 목적에 대해 유익한 귀납적 바이어스로 작용함을 시사한다.
마스크된 잠재 예측이 재구성 기반 방법보다 학습 효율이 높음
ImageNet 선형 프로빙 비교에서 SiamJEPA는 MAE와 유사한 수준의 표현 품질을 더 적은 사전학습 에폭으로 얻었다. 구체적으로 동일한 400 에폭에서 MAE는 Top-1 61.9%를 기록한 반면 SiamJEPA는 70.2%를 달성했다. 이 결과는 잠재 예측 목표가 계산 예산 대비 높은 전이 효율을 제공함을 의미한다.
광범위한 소거 연구로 설계 변수의 역할 규명
논문은 마스킹 전략, 가중치 감쇠, 예측기 깊이, CLS 대 풀링 표준 등 여러 구성 요소의 영향을 체계적으로 평가했다. 블록 마스킹이 적은 에폭에서 일관되게 우수한 성능을 보였고 높은 weight decay는 장기 학습에서 유리했다. 이 결과는 JEPA 스타일 모델을 현실적 제약 하에서 실용적으로 튜닝하는 근거를 제공한다.
핵심 아이디어 이해하기
전통적 joint embedding 방법은 서로 다른 시야의 표현을 동일한 잠재 공간에 정렬하여 의미적 일관성을 확보한다. JEPA는 이 방향을 잠재 예측으로 전환하여 가시적 문맥으로부터 마스크된 영역의 임베딩을 직접 예측한다. 이 접근은 픽셀 단위 재구성보다 표현의 추상화와 학습 효율을 높이는 작동 원리를 가진다. 시암스 학생 인코더는 동일한 가중치를 공유하는 두 분기를 독립 마스킹으로 운용하여 서로 다른 부분 관측에서 공통 정보를 포착하게 한다. 두 분기 사이의 KL 정합 항은 한 분기만으로도 다른 분기의 포스터리어를 근사하도록 학습 압력을 부여한다. 이로 인해 표현은 뷰 불변성을 갖추면서도 분별력을 유지하게 된다. 규제 관점에서 보면 시암스 구성은 JEPA의 주 손실인 마스크 예측 신호에 보완적 역할을 한다. 마스크 예측이 주된 학습 신호를 제공하는 동안 KL 항은 표현 붕괴를 억제하고 초기 학습 단계에서 안정적 방향으로 옵티마를 유도한다. 따라서 시암스 인코더는 최종 성능 자체뿐 아니라 학습 속도와 초기 표현 분리도에도 중요한 영향을 미친다. 실험적 관찰은 이 아이디어가 실무적 이득을 제공함을 뒷받침한다. 적절한 KL 가중치와 프리비트 설정은 초반 에폭에서 빠른 성능 향상을 유도했고 블록 마스킹과의 조합은 낮은 에폭 예산에서도 우수한 전이 성능을 산출했다. 이러한 점은 대형 자원 없이도 비교적 짧은 사전학습으로 고품질 표현을 얻을 가능성을 의미한다.
방법론
전체 접근은 두 개의 학생 인코더와 EMA 기반의 교사 인코더로 구성된 삼중 구조를 채택했다. 입력 이미지는 패치화되어 두 학생 분기에 독립적으로 마스킹된 뷰로 공급되며 교사 인코더는 마스킹 없는 전체 이미지를 처리한다. 학생 출력은 CLS 및 패치 토큰으로 분해되어 글로벌 정합과 패치 수준 예측을 위한 서로 다른 예측기에 입력된다. 핵심 메커니즘은 두 가지 손실로 구성된다. 글로벌 일치 목적은 두 학생 분기에서 추정한 잠재 분포의 포스터리어와 단일 분기 기반의 프라이어 사이의 KL 발산을 최소화하는 형태로 정의되며, 이때 프라이어 쪽에는 stop-gradient가 적용되어 안정성을 확보한다. 패치 수준 예측은 정규화된 평균제곱오차로 계산되어 EMA 교사에서 얻은 목표 임베딩을 재구성하는 것이 아니라 잠재 벡터를 직접 예측하는 데 초점을 둔다. 구현 세부에서는 ViT-Base 백본과 얕은 트랜스포머 기반 예측기를 사용했다. 마스킹은 블록 마스킹과 랜덤 마스킹을 비교했으며 프리비트와 λ_KL 하이퍼파라미터가 규제 강도를 조절했다. EMA 모멘텀은 학습 진행에 따라 0.99에서 0.9999로 단계적으로 증가시키는 스케줄이 적용되었다.
관련 Figure

그림은 단일 학생 인코더 JEPA와 SiamJEPA의 차이를 시각적으로 정리한다. JEPA는 하나의 학생 인코더와 EMA 교사를 사용해 마스크된 영역을 예측하는 반면 SiamJEPA는 두 개의 시암스 학생 인코더와 EMA 교사를 병렬로 운용하여 Sim-1과 Sim-2 손실이 어떻게 연결되는지 보여준다. 이 도표는 본문에서 주장하는 시암스 구조의 규제적 역할과 손실 항의 분리를 직관적으로 보강한다.
JEPA와 SiamJEPA 아키텍처의 구조 비교 다이어그램으로 학생·교사 인코더와 손실 연결을 표시한다.
주요 결과
주요 벤치마크로 ImageNet 선형 프로빙을 사용했고 ViT-Base 백본에서 비교 실험을 수행했다. 동일한 400 에폭 비교에서 논문은 MAE가 Top-1 61.9%인 반면 SiamJEPA는 Top-1 70.2%를 기록했으며 에폭별 성능 추이를 통해 SiamJEPA가 적은 에폭으로 동등하거나 우수한 성능에 도달함이 확인되었다. I-JEPA는 600 에폭에서 72.9%로 더 높은 값을 보였으나 학습 설정이 다르므로 직접 비교에는 주의가 필요하다. Ablation 연구에서 λ_KL 값 증가는 선형 프로빙 성능을 일관되게 향상시켰다. 예컨대 λ_KL=0.0001 설정은 에폭 300에서 66.78%를 기록한 반면 λ_KL=0.01 설정은 같은 시점에서 69.30%를 기록했다. 또한 프리비트 설정은 0.05에서 약간의 향상이 관찰되었으나 성능 민감도는 크지 않았다. 마스킹 전략 비교에서는 블록 마스킹이 특히 적은 에폭 예산에서 유리했으며 랜덤 마스킹도 적절한 비율 조정으로 경쟁력을 보였다. 이와 함께 중간층의 평균풀링이 CLS 토큰보다 초기 에폭에서 더 높은 전이 성능을 제공했음이 보고되었다.
관련 Figure

차트는 λ_KL의 값에 따른 KL 항과 총 손실의 학습 동역학을 제시한다. 작은 정규화 계수에서는 KL 값이 크게 유지되며 큰 계수에서는 KL이 자유비트 임계 근처로 빠르게 수렴함이 시각적으로 확인된다. 이 그래프는 KL 항이 규제 역할을 하여 초기 학습 거동과 수렴 속도에 영향을 미친다는 본문의 주장과 직접적으로 연결된다.
학습 곡선을 나타내는 차트로 에폭에 따른 총 손실과 Sim-1, Sim-2 항의 변화가 표시되어 있다.

이 플롯은 총 손실에서 Sim-2(마스크 예측)가 주요 학습 신호임을 수치적으로 확인시킨다. Sim-1(KL 정합)은 보조적 역할로 초기에는 변동이 크고 이후에는 상대적으로 작아지는 경향이 나타난다. 따라서 시각적 결과는 본문 결론과 일치하여 마스크 예측이 주된 학습 신호이고 KL은 규제자 역할임을 뒷받침한다.
에폭별 손실 값의 세부 변화를 보여주는 차트로 Sim-1과 Sim-2의 상대 기여를 비교한다.
기술 상세
아키텍처는 세 가지 인코더로 구성되며 학생 인코더 두 개는 가중치를 공유하는 Siamese 형태이고 교사 인코더는 EMA로 갱신된다. 입력은 패치화되어 positional embedding이 더해진 뒤 마스킹 연산을 통해 학생 분기로 들어가며 두 학생의 마스크 집합은 서로 비교집합이 되도록 설계되었다. 학습 시 학생의 출력은 CLS와 패치 임베딩으로 분리되어 글로벌 정합을 위한 선형 예측기와 패치 예측을 위한 트랜스포머 예측기로 전달된다. 수학적 손실 구성은 두 부분으로 명확히 나뉜다. Sim-1 항은 q 및 p 분포 간의 KL 발산으로 정의되고 실제 최적화에서는 prior 쪽에 stop-gradient를 적용한 KL_sg 형태가 사용되며 free-bit 임계값을 두어 KL이 완전 수렴하는 것을 방지한다. Sim-2 항은 마스크된 패치에 대해 목표 잠재 임베딩과 예측 임베딩 간의 Frobenius 기반 평균제곱오차로 정의되어 패치 수준 재구성이 아니라 잠재 예측이 직접 학습 신호가 된다. 학습 설정은 ViT-Base, 디코더 깊이 1, 배치 유효치 8192, AdamW 옵티마이저와 기본 학습률 1.5e-4 등을 사용했다. EMA 모멘텀 스케줄은 에폭 구간에 따라 0.99에서 0.9999로 증가하도록 설계되었고 weight decay와 마스킹 비율 등 하이퍼파라미터는 광범위한 소거 연구로 선택되었다. 실험은 V100/A100/H100 GPU에서 수행되었으며 일부 결과는 300 에폭 소규모 실험으로 검증된 뒤 최종 비교는 400 에폭으로 보고되었다.
관련 Figure

이 그림은 입력의 독립적 마스킹, 학생 분기에서의 CLS 및 패치 임베딩 분리, 그리고 선형 예측기와 확률적 예측기 파이프라인을 단계적으로 표현한다. 특히 posterior와 prior 구성 및 stop-gradient의 위치를 시각적으로 표시하여 KL 기반 Sim-1과 MSE 기반 Sim-2가 어떻게 계산되는지 연계성을 제공한다. 따라서 구현 관점에서 손실 계산 경로와 정보 흐름을 신속히 파악할 수 있다.
SiamJEPA의 상세 플로우로 두 학생 분기, 예측기 h와 g, EMA 교사 간 데이터 흐름을 표시한 다이어그램이다.
한계점
연구 자체에서 언급한 한계는 주로 상대적으로 작은 규모의 모델과 설정에서 실험이 수행되었다는 점이다. 또한 최종 성능이 구현 세부사항과 하이퍼파라미터에 민감하여 더 광범위한 스케일 업과 체계적 튜닝이 필요함이 기술되었다. 연구 범위는 이미지 기반 사전학습에 국한되어 있어 비디오나 대형 아키텍처로의 일반화 가능성은 추후 검증이 요구된다.
키워드
용어 해설
- 공동 임베딩 예측 아키텍처(JEPA)
- — JEPA는 이미지의 일부를 마스크하고 가시적 문맥으로부터 마스크된 영역의 잠재 임베딩을 예측하는 자기지도 학습 프레임워크이다. 이 방식은 픽셀 재구성 대신 잠재 공간에서 의미적 예측을 수행하여 표현의 추상화에 집중한다. 잠재 예측은 계산·샘플링 측면에서 효율성을 제공하며 JEPA 계열 모델의 핵심 작동 원리이다.
- 시암스 인코더(Siamese Encoder)
- — 시암스 인코더는 동일한 가중치를 공유하는 두 개의 학생 인코더를 병렬로 운용하여 독립적으로 마스킹된 두 시야를 처리하는 구조이다. 두 분기 간 출력을 정합시키는 제약을 통해 표현의 불변성 및 견고성을 유도한다. 본 논문에서는 JEPA의 학생 네트워크를 시암스 구조로 확장해 규제 효과를 평가했다.
- 지수 이동 평균(EMA)(Exponential Moving Average)
- — EMA는 교사 네트워크 파라미터를 학생 네트워크의 가중치 변화에 따라 지수적으로 평활한 방식으로 갱신하는 기법이다. EMA는 급격한 변화로 인한 학습 불안정을 줄이고 정적인 타깃을 제공하여 표현 붕괴를 방지하는 역할을 한다. JEPA 계열에서는 학생-교사 패러다임에서 안정화 수단으로 널리 사용된다.
- 프리비트(Free-bit)
- — 프리비트는 KL 손실 계산에서 최소 허용값을 부여해 두 분포가 완전히 동일해지는 것을 막는 하이퍼파라미터이다. 이 값은 표현이 지나치게 수렴하여 정보량이 사라지는 것을 방지하는 데 사용된다. 논문은 프리비트 설정이 성능에 일부 영향을 주나 민감도는 높지 않음을 보고했다.
- 마스크된 예측(Masked Prediction)
- — 마스크된 예측은 입력의 일부 토큰을 숨기고 가시 토큰으로부터 숨긴 토큰의 목표 표현을 예측하는 학습 목표이다. 이 방식은 픽셀 수준 재구성 대신 잠재 벡터를 타깃으로 삼아 의미적 정보를 더 직접적으로 학습한다. JEPA와 본 논문의 핵심 학습 신호는 이러한 마스크 기반 잠재 예측 손실이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.