용어 해설
- 멀티모달 대형 언어 모델(MLLM)
- — 텍스트뿐만 아니라 이미지, 오디오, 비디오 등 다양한 형태의 데이터를 동시에 처리하고 이해할 수 있는 AI 모델이다. 여러 감각 정보를 통합하여 인간과 유사한 다각적 추론을 수행하는 것이 핵심 목표다.
- 참조 접지(Referential Grounding)
- — 언어적 표현이 실제 영상이나 이미지 내의 어떤 구체적인 객체나 사건을 가리키는지 정확히 연결하는 기술이다. 멀티모달 모델이 텍스트와 시각 정보를 얼마나 일관되게 매핑하는지 평가하는 척도가 된다.
- 건초더미에서 바늘 찾기(Needle-in-a-Haystack)
- — 방대한 데이터 속에서 아주 작고 구체적인 정보를 정확히 찾아내는 능력을 의미한다. 비디오 AI에서는 수십 분의 영상 중 단 몇 초간 발생하는 사건을 기억하고 추론하는 능력을 평가할 때 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.