고난이도 음성 샘플링
검색 모델 학습에서 단순 무작위 음성 대신 같은 서브타입 또는 같은 카테고리에서 선택된 시각적으로 혼동되기 쉬운 음성 샘플을 배치에 포함시키는 전략이다. 이 논문은 세 단계(같은 서브타입, 같은 카테고리, 무작위) 우선순위를 사용해 실제로 혼동되는 예시로 모델을 학습시켜 판별력을 높였다. 결과적으로 모델은 단순한 구별이 아닌 미세한 구분에 강해져 R@K 성능이 향상되었다.