본문으로 건너뛰기

Missing Modalities에서 강건한 다중 모달 imitation learning을 위한 Reinforcement-Learning-Guided Retrieval with Soft Fusion

로봇 시스템은 시각 카메라+언어 지시 등 여러 모달리티를 사용해 의사결정을 하지만, 센서 드롭아웃으로 모달리티가 사라질 때 기존 imitation learning 방법은 재현성이 떨어진다. RL4IL은 frozen encoder를 유지한 채 BFS-확장 후보 셋에서 가장 관련성 높은 시연을 RL로 선택하고, soft cross-attention으로 다수의 후보를 융합해 missing modality 상황에서도 재훈련 없이 robust한 예측을 달성한다. LIBERO 벤치마크에서 카메라 드롭아웃 조건 하의 성능이 크게 향상된다.

용어 해설

모달리티 공정 거리(modality-fair distance)
여러 모달리티의 임베딩 간 거리를 각 모달리티의 차원 수로 정규화한 뒤 평균화하여 계산하는 거리 척도이다.
소프트 크로스-어텐션(soft cross-attention)
상위 후보들에 대해 교차-어텐션을 적용하여 가중합된 신호로 최종 예측을 생성하는 융합 헤드이다.
너비 우선 탐색(Breadth-First Search)
입력 소스의 초기 이웃들로부터 BFS를 수행하여 그래프 상의 후보 집합을 확장하는 탐색 전략이다.
kNN 검색(kNN retrieval)
쿼리와의 거리 기반으로 초기 이웃을 선택하고 후보군을 구성하는 근접 이웃 탐색 방법이다.
모달리티별 임퓨테이션(per-modality imputation)
Inference 시 누락된 모달리티를 다른 모달리티로 보완해 임베딩 벡터를 재구성하는 2단계 파이프라인이다.
PPO(프로시멀 정책 최적화)(PPO)
랭킹 정책을 학습하기 위한 옵티마이제이션 기법으로, 클리핑된 대리함수 objective를 사용한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 13.수집 2026. 06. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.