용어 해설
- 옴니모달 대형 언어 모델(Omnimodal LLM)
- — 텍스트, 이미지, 비디오뿐만 아니라 오디오 신호까지 동시에 입력받아 통합적으로 이해하고 생성할 수 있는 인공지능 모델이다. 여러 감각 정보를 하나의 신경망에서 처리하여 인간과 유사한 다중 감각 인지 능력을 구현하는 것이 핵심이다.
- 시간적 국소화(Temporal Localization)
- — 긴 영상이나 오디오 스트림 내에서 특정 사건이나 정보가 발생하는 정확한 시점을 찾아내는 기술이다. 수십 분 분량의 데이터에서 질문에 답하기 위한 핵심 구간을 식별해야 하므로 모델의 장기 기억과 정밀한 검색 능력이 요구된다.
- 교차 모달리티 정렬(Cross-modal Alignment)
- — 서로 다른 형태의 데이터(예: 비디오의 시각 정보와 오디오의 소리 정보) 사이의 상관관계를 파악하여 의미적으로 연결하는 과정이다. 예를 들어 화면 속 인물의 입모양과 들리는 목소리를 일치시키거나, 배경 음악의 분위기와 영상의 시각적 톤을 연결하는 작업이 포함된다.
- 자동 음성 인식(ASR)
- — 오디오 신호에서 사람의 말을 추출하여 텍스트로 변환하는 기술이다. 옴니모달 모델이 원시 오디오 신호를 직접 처리하지 못할 때, ASR을 통해 변환된 텍스트를 보조 정보로 활용하여 이해도를 높이기도 한다.
코드 예제
Question: <question>
Options: <options_str>
Select the best answer from the options above. Directly provide the letter representing your choice (A/B/C/D) and nothing else. Do not include the full text of the option; do not provide any explanation.LVOmniBench 평가를 위해 사용된 표준 프롬프트 템플릿
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.