용어 해설
- 옴니모달(Omni-Modal)
- — 텍스트, 이미지, 비디오, 오디오 등 현존하는 거의 모든 데이터 형태(Modality)를 동시에 받아들이고 처리할 수 있는 기술적 특성이다. 기존 멀티모달이 특정 조합(예: 이미지-텍스트)에 집중했다면, 옴니모달은 이들을 통합적으로 이해하여 더 복잡한 현실 세계의 문제를 해결하는 데 필수적이다.
- 다단계 추론(Multi-hop Reasoning)
- — 하나의 질문에 답하기 위해 여러 단계의 논리적 추론이나 정보 검색을 순차적으로 수행하는 과정이다. 예를 들어 '영상 속 건물의 완공 연도와 현재 나이 차이'를 구하려면 건물 식별, 완공일 검색, 현재 날짜 계산이라는 여러 단계를 거쳐야 하며 에이전트의 지능을 평가하는 핵심 지표가 된다.
- 이벤트 그래프(Event Graph)
- — 데이터 내에 존재하는 개체(Entity), 사건(Event), 그리고 이들 사이의 관계를 노드와 엣지로 연결하여 구조화한 지도이다. 비정형 데이터인 영상이나 오디오에서 핵심 정보를 추출해 논리적 연결 고리를 만듦으로써, 모델이 복잡한 인과 관계를 파악하고 다단계 질문을 생성할 수 있게 돕는다.
- 직접 선호도 최적화(DPO)
- — 별도의 보상 모델 없이 모델이 생성한 두 가지 결과물 중 사람이 선호하는 쪽을 직접 학습시켜 모델의 행동을 정렬하는 기법이다. 이 논문에서는 에이전트의 실행 궤적 중 오류가 발생한 지점을 찾아 올바른 행동을 하도록 미세 조정하는 OmniDPO 방식으로 응용되었다.
- 능동적 지각(Active Perception)
- — 모델이 주어진 데이터를 수동적으로 한꺼번에 읽는 대신, 필요한 시점에 특정 구간이나 영역을 선택적으로 다시 확인하는 메커니즘이다. 긴 영상이나 고해상도 이미지에서 토큰 소모를 줄이면서도 중요한 세부 정보를 놓치지 않게 해주는 에이전트의 핵심 기능이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.