용어 해설
- Frozen 인코더(Frozen Encoders)
- — VLM 스타일 아키텍처에서 텍스트 백본과 비텍스트 인코더를 고정시키고, 모달리티 간 정렬을 달성하기 위한 기법으로, 모달리티별 인코더의 가중치를 재학습하지 않고 소수의 학습 가능한 프로젝터로 텍스트 임베딩 공간에 매핑한다.
- 프로젝터(Projectors)
- — 비텍스트 인코더의 출력을 텍스트 백본의 숨김 공간으로 매핑하기 위해 학습 가능한 선형 계층(fc_vision_2, fc_audio)을 도입하는 방식으로, frozen 텍스트 임베딩과의 호환성을 보장한다.
- 마트료시카 표현 학습(Matryoshka Representation Learning)
- — 다단계(prefix) 차원 축소를 통해 점진적으로 표현 정보를 보존하는 트레이닝 전략으로, L_NCE 손실이 다수의 부분 차원에서 합산되도록 설계된다.
- InfoNCE 손실(InfoNCE)
- — 배치 내 양성 쌍과 음성 쌍의 코사인 유사도의 차이를 로짓으로 만들어 소프트맥스 확률을 얻고, 이를 로그 손실로 최적화하는 대조 학습 손실 함수이다.
- LoRA 어댑터(LoRA adapters)
- — 대상 모듈의 소수의 랭크-저차원 행렬만 학습시키는 파라미터 효율적 파인튜닝 기법으로, 기존 텍스트 백본의 LoRA 어댑터를 보존한 상태에서 모달리티 확장을 가능하게 한다.
- VLM 스타일 아키텍처(VLM-style architectures)
- — Vision-Language Model 스타일 아키텍처로, 비텍스트 모듈의 출력을 텍스트 언어 모델의 입력으로 연결해 단일 시맨틱 임베딩 공간으로 매핑한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







