본문으로 건너뛰기

시각적 열화에 대응한 멀티모달 추론 강화

멀티모달 대형언어모델은 실제 세계의 노이즈가 많은 시각 입력에서 불안정하다. ROMA는 critic-free GRPO 기반 RL 파인튜닝에 시각 열화에 대한 견고한 추론을 주입하기 위해 dual-forward-pass, token-level KL invariance, adversarial 다중 뷰 정규화, 교육 보조 그래디언트를 결합한다. 이로써 깨끗한 입력 성능을 유지하면서 seen/unseen corruptions에 대한 견고함이 향상된다.

용어 해설

토큰-수준 KL 발산(Token-level KL Divergence)
autoregressive 생성에서 깨끗한 입력과 degraded 입력 간의 토큰 분포를 KL 발산으로 정합시키는 기법. stop-gradient를 사용해 깨끗한 정책 표현을 보존하면서 degraded 입력과의 분포 차이를 최소화한다.
최악의 경우 다중 뷰 최적화(Worst-Case Multi-View Optimization)
여러 degraded 뷰 중 가장 큰 분포 차이를 유도하는 뷰에만 정규화를 적용하는 최적화 전략으로, adversarial한 시각 변화에 대해 모델의 견고함을 강화한다.
정확성 조건부 정규화(Correctness-Conditioned Regularization)
정확한 clean 롤아웃이 확보된 경우에만 invariance 정규화를 적용하여, 정합성 없는 강제 일반화를 방지하는 규칙화 기법이다.
보조 정책 그래디언트(Auxiliary Policy Gradient)
degraded 뷰에 대해 보조 경사 하강법을 수행하되, 클린 이점을 기준으로 앵커링해 보상 신호의 신뢰성을 유지하는 학습 신호이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 10.수집 2026. 05. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.