본문으로 건너뛰기
HF Daily Papers조회 1

왜 내 서랍을 열 수 없나? 제로샷 조합 행동 인식에서 객체 주도 숏컷 완화

RCORE는 합성 조합 감독(CPR)과 시간순서 정규화(TORC)를 결합해 Sth-com과 EK100-com에서 unseen 조합 정확도를 최대 7.0포인트 향상시켰다.

용어 해설

제로샷 조합 행동 인식(Zero-Shot Compositional Action Recognition)
학습 시 관찰된 동사와 명사(객체) 원소들을 조합하여 학습에 없던 동사–객체 쌍을 인식하는 문제로, 테스트 시에는 기존 어휘의 새로운 조합(unseen composition)만 등장하고 새로운 단어는 등장하지 않는다.
공동발생 우선성(Co-occurrence Prior)
학습 데이터에서 특정 동사와 객체 쌍이 자주 함께 등장하는 통계적 편향으로, 모델이 시간적·동작적 근거 대신 빈번한 쌍에 기반해 예측하는 숏컷을 유발한다.
시간순서 정규화(Temporal Order Regularization)
영상의 프레임 순서를 보존하는 정보에 모델이 의존하도록 유도하는 손실 구성으로, 역순·무작위 섞임에 민감한 표현을 학습시켜 동사 인식의 시간적 기초를 강화한다.
거짓-학습-예측(FSP)(False Seen Prediction (FSP))
unseen 샘플이 잘못 분류될 때 그 예측이 훈련에 등장한(seen) 조합으로 수렴하는 비율로, 객체 주도 숏컷의 지표로 사용되어 동사 예측이 공동발생 통계에 의존하는지를 계량한다.
조합 격차(Compositional Gap)
모델의 조합 예측 정확도(Acc^C)에서 동사 정확도와 객체 정확도의 독립적 곱(Acc^V × Acc^O)을 뺀 값으로, 공동 예측이 개별 성능을 초과하는지를 측정하는 진단 지표이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.