용어 해설
- 플라토닉 표현 가설(Platonic Representation Hypothesis)
- — 서로 다른 모달리티의 표현 공간이 국소적으로 동일한 이웃 구조를 보유한다는 가설이다. 이 가설은 의미적으로 유사한 입력이 각기 다른 잠재공간에서 유사한 근접 이웃을 갖는다고 가정하며, 서로 다른 모달 간 위상적 일관성을 정량화하는 근거를 제공한다. 본문에서는 이 가설을 근거로 지역적 이웃 구조를 보존하는 정렬이 멀티모달 성능 향상으로 이어질 수 있음을 실험적으로 검증했다.
- 상호 K-최근접 이웃(MKNN)(Mutual K-Nearest Neighbor)
- — 두 표현 함수가 동일한 데이터 포인트에 대해 생성하는 국소 이웃 집합의 일치를 측정하는 메트릭이다. 각 샘플에 대해 k-최근접 이웃을 구한 뒤 언어 표현과 시각 표현의 교집합 비율을 평균해 0~1 범위의 정렬 점수를 얻는다. 본문에서는 MKNN을 헤드 수준 진단 지표로 활용해 정렬 우선순위를 결정하고 이를 학습 목표의 근사로 삼았다.
- 헤드 단위 표현 정렬(Head-wise Representation Alignment)
- — Transformer의 개별 attention head 출력에 대응하는 표현을 대상으로 외부 비전 인코더와의 국소적 이웃 구조를 맞추는 정렬 기법이다. 각 헤드에서 추출한 표현을 출력 프로젝션 블록으로 투사한 뒤 contrastive objective를 적용해 해당 헤드의 이웃 구조가 비전 쪽과 일치하도록 유도한다. 본문에서는 이 접근이 고정 레이어 정렬보다 언어모델의 언어 성능을 덜 해치면서 비전 성능을 향상시킴이 확인됐다.
- InfoNCE 대조 손실(InfoNCE)
- — 타깃 이웃과의 유사도를 양성 샘플로, 배치 내 다른 샘플들을 음성으로 취급하여 소프트맥스 비율의 음의 로그를 최소화하는 대조 학습 손실이다. 본문에서는 다중 타깃 변형을 사용해 각 샘플이 teacher vision encoder에서 계산한 k-최근접 이웃들과 유사해지도록 학습시켰다. τ 하이퍼파라미터가 확률 분포의 샤프니스(온도)를 조절하며 이 값은 학습 중 최적화 대상이 되기도 했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

