본문으로 건너뛰기

ReMMD: 현실적 다국어 다중 이미지 에이전트 검증을 위한 멀티모달 허위정보 탐지

현실 세계의 허위정보 게시물은 긴 다국어 텍스트와 여러 이미지를 결합해 부분적 진실과 교차모달 왜곡을 만든다. 단일 캡션·단일 이미지·이진 라벨 중심의 기존 벤치마크는 이러한 검증 압력을 반영하지 못하며, ReMMDBench와 ReMMD-Agent는 원자적 분해와 증거 재사용으로 실제 운영 환경에 더 근접한 평가와 비용 효율적 검증을 제공한다.

용어 해설

에이전트형 검증(Agentic Verification)
사건을 여러 '작업 단위'(검색, 질의, 이미지 분석 등)로 분해하여 도구 호출과 검색을 반복하면서 근거를 수집하고 누적된 증거 기반으로 최종 판단을 내리는 방식이다. ReMMD에서는 긴 다중 이미지·다국어 게시물을 원자적 단위로 분해하고 검색·증거 재사용을 통해 비용을 줄이며 판정 근거를 추적 가능하게 만든다.
지속성 메모리 뱅크(Persistent Memory Bank)
샘플 수준에서 검색 결과(뉴스, fact-check, 이미지 설명 등)를 구조화해 저장하는 영속적 저장소이다. 각 레코드는 출처, 타임스탬프, 신뢰성 메모 등을 포함하며 서로 다른 원자적 포인트에서 재사용되어 중복 검색을 줄이고 근거 집계를 가능하게 한다.
원자적 포인트 분해(Atomic Point Parsing)
긴 텍스트와 복수 이미지에서 검증 가능한 최소 단위(문장 클레임, 이미지 관찰, 이미지-텍스트 바인딩 등)를 추출해 쿼리와 시각적 단서를 연결하는 절차이다. 최대 12개의 포인트만 유지해 불필요한 검색을 줄이고 판정의 추적성을 확보한다.
교차 모달 바인딩(Cross-Modal Binding)
텍스트 내 특정 주장과 하나 이상의 이미지를 연결해 이미지가 주장하는 이벤트·장소·인물·시간 등과 일치하는지 검토하는 과정이다. 이미지의 진위와 텍스트의 진위는 별도로 평가되며, 바인딩 불일치는 L2 왜곡 레이블의 주요 원인이다.
왜곡 레이블(Distortion Labels)
텍스트 왜곡, 시각적 편집/합성, 그리고 교차 모달 불일치 등을 8가지 범주로 분류한 다중 레이블 체계이다. 한 샘플에서 다수 레이블을 허용하여 혼합형 오류(예: 진짜 이미지가 잘못된 사건에 붙여진 경우)를 정밀 진단한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.