본문으로 건너뛰기

다중 모달 언어 모델 향상: 시각적 편향 제거 평가를 통한 단계적 포스트 트레이닝

Omni-modal LLM은 오디오, 비주얼, 텍스트를 함께 이해하도록 설계되었으나 벤치마크의 성과는 시각적 단서에 의해 과대평가될 수 있다. 본 연구는 시각적 leakage를 제거하는 운영 뷰인 OmniClean을 제시하고, 이 뷰를 바탕으로 3단계 포스트 트레이닝 OmniBoost를 통해 소형 모델에서도 의미 있는 omni-modal 능력 향상을 보인다. 시각 누출에 대한 평가 제어가 있으면 omni-modal 진보의 해석이 더 명확해진다.

용어 해설

시각적 누출(visual leakage)
다중 모달 질의에서 시각 입력만으로도 정답이 가능해 모델의 실제 omni-modal 이해를 왜곡하는 현상이다. 이 현상은 벤치마크의 원래 점수에 시각 정보의 강한 영향력을 남겨 두며, 시각적 편향 제거가 필요한 주된 이유를 제공한다.
OmniClean
9개 옴니-벤치마크에 대한 시각적 편향 제거 평가 뷰로, queries를 시각적 프로빙으로 검토하고 시각적으로 해결 가능한 쿼리를 제거하여 남은 샘플만을 평가에 반영하는 운영적 평가 체계이다.
OmniBoost
Qwen2.5-Omni-3B 베이스를 시작점으로 한 3단계 포스트 트레이닝 파이프라인으로, mixed bi-modal SFT, mixed-modality RLVR, self-distillation SFT를 순차적으로 적용하여 omni-modal 성능을 향상시키는 방법이다.
RLVR
mixed-modality 강화 학습 기반 보상 최적화 기법으로, 텍스트/비주얼/오디오 입력 간의 옴니-근거(reasoning) 능력을 강화하도록 설계된 RL 서브모듈이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 13.수집 2026. 05. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.