용어 해설
- 시각 언어 모델(VLM)
- — 이미지와 텍스트를 동시에 이해하고 처리할 수 있는 인공지능 모델이다. 이미지의 시각적 특징을 추출하는 Vision Encoder와 이를 해석하는 Language Model이 결합된 구조를 가지며, 이미지 캡셔닝이나 시각 질의응답(VQA) 등에 사용된다.
- 사고의 사슬(Chain-of-Thought)
- — 모델이 최종 답을 내놓기 전에 중간 추론 과정을 단계별로 생성하도록 유도하는 프롬프트 기법이다. 복잡한 논리적 판단이 필요한 문제에서 모델의 정확도를 높이는 데 효과적이며, 본 논문에서는 이미지 비교 시 유용성이 입증되었다.
- 디노v3(DINOv3)
- — 자기 지도 학습(Self-supervised Learning)을 통해 이미지의 강력한 특징 표현을 학습하는 비전 모델이다. 본 논문에서는 두 이미지 사이의 시각적 유사도를 측정하여 미세한 차이를 정의하는 기준으로 사용되었다.
- 시각 질의응답(VQA)
- — 주어진 이미지에 대해 자연어로 질문을 던지면 모델이 그에 맞는 답을 생성하는 태스크이다. 이미지 내 객체의 존재, 속성, 관계 등을 종합적으로 이해해야 풀 수 있는 고난도 시각 지능 평가 방식이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.