왜 중요한가
사회적 영상 질문응답은 시선·제스처·발화 내용·톤·시간적 단서 등이 결합돼 의미가 형성되며 단순한 멀티모달 입력 통합만으로는 올바른 증거를 선택할 수 없다. 이 논문은 샘플별 증거 구조를 훈련 전용 스키마로 표준화해 MoE 라우터가 어떤 모달리티와 어느 시점을 이용해야 하는지를 학습하도록 만들었다. 그 결과 증거 일치성과 시간적 근거를 보상으로 포함하는 강화학습까지 결합해 사회적 추론 성능이 유의미하게 향상되었다.
핵심 기여
스키마 정렬 예측 라우팅(SAPR)으로 샘플 수준 라우팅 학습
SAPR은 각 훈련 샘플에 대해 세 축(증거 출처, 추론 요구, 시간 범위)으로 구성된 인지 스키마 태그를 사용한다. 레이어별 모달리티 풀링된 라우팅 분포를 합성해 전역 라우팅 서명을 만들고 예측 헤드를 통해 태그 임베딩과 코사인 유사도로 정렬하도록 손실을 추가한다. 이로 인해 동일한 정답이라도 필요한 모달리티와 시점을 반영하는 라우팅 패턴이 형성되었다.
토큰 생성과 라우터 선택을 동시에 최적화하는 RMRL
Route-Aware MoE Reinforcement Learning은 생성 롤아웃 수준의 복합 보상을 사용해 토큰 정책과 게이트(라우터) 확률을 동시에 갱신한다. 보상은 정답 정확도, 모달리티 일관성 점수(LLM 평가자), 그리고 인지적 시간적 근거(CTG)로 구성되며 GRPO 스타일의 클리핑된 손실로 토큰 분기와 게이트 분기 모두에 적용된다. 결과적으로 올바른 증거·시점을 사용해 정답을 도출한 라우팅 결정의 확률이 명시적으로 증가했다.
증거-주석과 근거 추적을 포함한 진단용 데이터셋 OmniSocialBench
OmniSocialBench는 118K의 구조화된 학습 예시와 수동 검증된 평가 분할을 포함한다. 각 샘플은 시각·오디오 근거 항목, 스키마 라벨, 추론 트레이스, 그리고 시간 근거 스팬을 보유해 라우팅과 근거 기반 보상 학습을 지원한다. 평가 분할은 Mental State, Pragmatic Meaning, Action Goal, Social Norm 같은 소셜 차원으로 진단 분석을 가능하게 한다.
광범위한 벤치마크에서의 전이성 및 실체적 성능 개선
CogniRoute는 OmniSocialBench에서 평균 59.38% 정확도를 기록해 동급의 최강 오픈·상용 베이스라인 대비 유의미한 이득을 보였다. SAPR로만 감독학습을 수행하면 평균 정확도가 40.13%에서 50.13%로 상승했고, RMRL을 더하면 최종 59.38%에 도달했다. 또한 Qwen3-Omni-30B 대비 대부분의 오디오·비주얼 벤치마크에서 성능이 개선되어 제안한 라우팅 정렬과 라우트 중심 RL의 범용성이 확인되었다.
관련 Figure
핵심 아이디어 이해하기
사회적 멀티모달 질문응답은 입력에서 여러 증거가 공존할 때 어떤 증거를 신뢰해야 하는지 결정하는 문제가 핵심이다. 기존의 오미니모달 LLM 또는 MoE는 다중 모달을 동일한 모델로 처리할 수 있으나 라우터는 주로 토큰 로컬 표현에 의해 결정되어 샘플 수준의 '어떤 모달·어떤 시간' 단서를 분별하도록 명시적으로 학습되지 않았다. 이로 인해 정답은 맞더라도 잘못된 모달이나 잘못된 시점에 근거해 예측하는 편향이 발생했다.
방법론
전체 접근은 두 단계 훈련으로 구성된다. 첫 단계는 supervised fine-tuning으로서 SAPR 손실을 추가해 레이어별 모달리티 풀링 라우팅 분포를 합성하고 이를 태그 임베딩 합과 코사인 유사도로 정렬해 전역 라우팅 서명을 스키마 라벨에 맞추도록 학습시킨다. 이러한 정렬은 라우터의 밀집(pre-top-k) 확률을 사용해 모든 전문가에 신호를 전파하고 레이어별 투영 Pl을 통해 각 레이어의 전문가 인덱스 차이를 보정한다.
관련 Figure
주요 결과
주요 실험 결과는 OmniSocialBench에서의 유의미한 성능 향상이다. CogniRoute는 평가에서 평균 정확도 59.38%를 기록해 상용 모델 Gemini 3.1 Pro 대비 +15.33 포인트, 가장 강한 오픈소스 옴니 모델 대비 +26.77 포인트의 개선을 보였다. SAPR만 적용한 SFT 단계에서 평균 정확도는 40.13%에서 50.13%로 상승했고 RMRL을 추가하면 최종 59.38%에 도달했으며 특히 Action Goal과 Social Norm 같은 소셜 추론 카테고리에서 이득이 크게 나타났다.
관련 Figure
기술 상세
아키텍처는 텍스트 토크나이저, 비전 토크나이저, 오디오 토크나이저를 통해 시공간 정렬된 토큰을 만들고 Omni MoE 백본의 각 MoE 레이어에서 라우터가 dense pre-top-k 분포 ρ_lθ(hi,l)를 출력한다. 각 레이어와 모달리티별로 토큰을 풀링해 p¯^m_l를 만들고 Pl으로 투영한 뒤 레이어 평균으로 전역 라우팅 서명 g를 얻는다. 태그 임베딩 Wtag의 선택된 라벨 집합 𝒞의 임베딩 합 s와 Hpred(g) 간의 코사인 손실 ℒSAPR = 1 − cos(sˆ, s)를 최소화한다.
한계점
데이터셋과 실험은 사전 분할된 클립과 텍스트 정답 형식을 전제로 한다는 한계가 있다. 스트리밍 입력, 실시간 대화 관리, 혹은 음성 합성 품질은 본 논문에서 평가 대상이 아니었다. 또한 현재 방법은 MoE 기반 백본 설계에 의존하므로 MoE가 아닌 아키텍처로의 직접 적용에는 추가 설계가 필요하다는 점이 명시되었다.
실무 활용
CogniRoute는 멀티모달 입력에서 올바른 모달·시점 기반 증거를 식별해야 하는 응용에 적합하다. 라우팅 정렬과 라우트 중심 RL으로 모델이 근거를 명확히 사용하는 쪽으로 편향되며 오답의 '우회 경로'를 줄인다. 실제 예로 연구팀은 VR 스마트 글라스 실시간 보조에 시범 배치해 사회적 의도 추론에서 유용성을 확인했다.
- 증거 근거가 중요한 보조적 영상 해석 시스템에서 발화자 지시·참조 해석 보강
- 실시간 대인 상호작용 보조(예: VR/AR 환경)에서 의도 추론과 행동 제안
- 사회적 로봇이나 상담 보조 시스템에서 음성·시선·제스처를 통합한 신뢰성 높은 추론
- 감정·정책 판단에 시간적 근거가 필요한 멀티모달 감사·분석 도구
코드 공개 여부: 미확인
키워드
용어 해설
- 혼합전문가(MoE)(MoE (Mixture-of-Experts))
- — MoE는 입력마다 일부 전문가(expert)만 활성화해 계산을 조건부로 수행하는 아키텍처이다. 토큰별 또는 레이어별 라우터가 확률 분포를 산출하고 상위 k개의 전문가를 선택해 연산을 분산시키며 모델 용량을 크게 늘리면서 계산 비용은 제한한다. 본 논문에서는 MoE의 라우팅 행위를 학습 데이터 수준의 스키마로 정렬해 증거 기반 멀티모달 추론에 맞추는 핵심 수단으로 사용한다.
- 스키마 정렬 예측 라우팅(SAPR)(Schema-Aligned Predictive Routing (SAPR))
- — SAPR은 훈련 전용의 '인지 스키마' 라벨을 이용해 전역 라우팅 서명을 해당 샘플의 증거 구조(모달 간 관계·추론 요구·시간 범위)에 맞추도록 학습시키는 보조 목적함수이다. 각 레이어별 모달리티 풀링된 라우팅 확률을 합성해 전역 임베딩을 만들고 태그 임베딩과 코사인 유사도로 정렬한다. 이 정렬은 추론 시 어떤 전문가 조합을 쓰는지가 샘플의 증거 특성과 상관관계를 갖도록 유도한다.
- 라우트 인지형 MoE 강화학습(RMRL)(Route-Aware MoE Reinforcement Learning (RMRL))
- — RMRL은 생성된 출력 전체 롤아웃에 대해 정답 보상, 모달리티 일관성 보상, 시간 근거 보상 등 복합 보상으로 토큰 생성뿐 아니라 라우터의 전문가 선택 확률까지 함께 업데이트하는 강화학습 단계이다. 토큰 분기와 게이트 분기 각각에 GRPO 유사한 클리핑 기반 손실을 적용해 보상 신호가 선택된 전문가 집단의 확률을 직접 증가시키도록 한다. 이로써 동일한 정답이라도 적절한 모달·시점에 근거해 답하도록 라우팅을 개선한다.
- 인지적 시간적 근거(CTG)(Cognitive Temporal Grounding (CTG))
- — CTG는 모델의 최종 추론 어절들에서 오디오·비디오 입력 토큰에 대한 인과적(또는 원인적) 주의를 시간축으로 집계해 주어진 정답의 근거 시점과 얼마나 일치하는지를 KL divergence로 측정하는 보상이다. reasoning suffix의 인과적 attention을 시간 구간으로 풀링한 분포 α˜와 어노테이션 기반 가우시안 목표 분포 Pgt 사이의 DKL을 사용해 보상값을 계산한다. 이 보상은 정답 일치만으로는 구분되지 않는 '올바른 시점 사용'을 학습 신호로 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.