용어 해설
- 대조 학습(Contrastive Learning)
- — 유사한 데이터 쌍은 가깝게, 다른 데이터 쌍은 멀게 배치하도록 모델을 학습시키는 기법이다. 임베딩 모델 학습의 표준이지만 대규모의 정제된 쌍 데이터가 필수적이라는 한계가 있다.
- 자가 지도 학습(Self-Supervised Learning)
- — 데이터 자체에서 정답을 생성하여 모델을 학습시키는 방식이다. 별도의 수작업 레이블링 없이 대량의 데이터를 활용할 수 있어 효율적이며, 본 논문에서는 LLM의 응답을 정답으로 활용한다.
- 지식 증류(Distillation)
- — 거대한 교사 모델의 지식을 작은 학생 모델에게 전달하는 기법이다. 본 논문에서는 외부 임베딩 모델을 교사로 삼아 LLM의 응답이 가진 의미 구조를 특수 토큰에 이식한다.
- 로짓 렌즈(Logit Lens)
- — 모델의 중간 레이어 은닉 상태를 어휘 공간으로 투영하여 모델이 내부적으로 어떤 단어를 생성하려 하는지 분석하는 기법이다. 이를 통해 임베딩 벡터가 실제 어떤 의미를 담고 있는지 해석할 수 있다.
- 정보 병목(Information Bottleneck)
- — 입력 정보에서 불필요한 노이즈를 제거하고 핵심적인 특징만을 남기도록 제한하는 구조이다. 본 논문에서는 압축 토큰을 통해 수백 단어의 응답을 단 10개의 벡터로 압축하여 정보의 정수만을 남긴다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.