본문으로 건너뛰기
HF Daily Papers조회 7

촉각을 통한 시각화: 재질 영역의 촉각 기반 시각적 국소화

인간이 물체를 만졌을 때의 느낌을 시각적 정보와 연결하는 능력을 AI로 구현하여, 촉각 신호만으로 이미지 내에서 동일한 재질을 가진 영역을 정확히 찾아낼 수 있다. 이는 로봇의 물체 조작이나 재활용 분류 등 시각과 촉각의 통합이 필요한 실제 환경에서 AI의 판단 능력을 크게 향상시킨다.

왜 중요한가

인간이 물체를 만졌을 때의 느낌을 시각적 정보와 연결하는 능력을 AI로 구현하여, 촉각 신호만으로 이미지 내에서 동일한 재질을 가진 영역을 정확히 찾아낼 수 있다. 이는 로봇의 물체 조작이나 재활용 분류 등 시각과 촉각의 통합이 필요한 실제 환경에서 AI의 판단 능력을 크게 향상시킨다.

핵심 기여

STT(Seeing Through Touch) 프레임워크 개발

촉각 신호와 시각적 특징 사이의 미세한 국소적 대응 관계를 학습하기 위해 밀집 교차 모달 특징 상호작용(dense cross-modal feature interactions)을 사용하는 모델을 구축했다.

재질 다양성 기반 페어링 전략

동일한 재질 카테고리 내에서 시각적으로는 다양하지만 촉각적으로 일관된 이미지들을 연결하여 모델의 일반화 성능과 약한 촉각 신호에 대한 강건성을 확보했다.

In-the-wild 멀티 재질 데이터셋 구축

실제 환경의 복잡성을 반영하기 위해 웹에서 수집한 다양한 재질이 포함된 장면 이미지 데이터셋과 정밀한 세그멘테이션 마스크를 포함한 벤치마크를 제작했다.

핵심 아이디어 이해하기

기존의 시각-촉각 학습은 이미지 전체와 촉각 신호 하나를 매칭하는 'Global Alignment' 방식에 의존했다. 이는 이미지 안에 어떤 재질이 있는지는 알 수 있지만, 그 재질이 이미지의 '어느 부분'에 위치하는지 파악하는 국소화(Localization) 능력은 부족하다는 한계가 있다.

이 문제를 해결하기 위해 본 논문은 이미지의 각 픽셀 위치에 해당하는 특징(Feature)들과 촉각 신호의 특징을 직접 비교하는 방식을 채택했다. 이미지 인코더를 통해 생성된 HxW 크기의 특징 맵과 촉각 인코더에서 나온 특징 벡터 사이의 유사도를 모든 위치에서 계산하여 '촉각 살리언시 맵(Tactile Saliency Map)'을 생성한다.

특히 촉각 데이터는 센서를 누르기 시작하거나 뗄 때 신호가 매우 약해지는 특성이 있는데, 이를 극복하기 위해 '재질 다양성 기반 페어링'을 도입했다. 이는 같은 재질이라면 겉모습이 조금 다르더라도 동일한 촉각 경험을 제공한다는 점을 이용해, 하나의 촉각 샘플을 여러 장의 다양한 이미지와 연결하여 학습시킴으로써 모델이 재질의 본질적인 시각적 특징을 더 잘 파악하게 만든다.

방법론

전체 아키텍처는 시각 인코더(Vision Encoder)와 촉각 인코더(Tactile Encoder)로 구성되며, 두 인코더 모두 DINOv3 Small 모델을 백본으로 사용한다. 각 백본 뒤에는 Channel-wise LayerNorm과 1x1 Convolution 레이어로 구성된 Aligner 모듈을 추가하여 두 모달리티의 특징을 공유된 표현 공간으로 매핑한다.

유사도 계산을 위해 먼저 촉각 특징 맵 ft를 공간적으로 평균 내어 1차원 벡터 f_t_bar를 생성한다. [ft ∈ R^C×H×W → 공간 평균 연산 → f_t_bar ∈ R^C]. 그 후 시각 특징 맵 fv의 각 위치 [h, w]에 있는 벡터와 f_t_bar 사이의 내적(Inner Product)을 계산하여 유사도 맵 M을 얻는다. [f_t_bar · fv[h, w] → 내적 연산 → M[h, w]]. 이 결과값은 특정 촉각 입력이 이미지의 각 영역과 얼마나 일치하는지를 나타내는 점수가 된다.

학습은 대조 학습(Contrastive Learning) 목적 함수를 사용하며, 동일한 재질 인스턴스 내의 페어뿐만 아니라 동일 카테고리의 다른 인스턴스(In-domain), 그리고 웹에서 수집한 이미지(Out-domain)를 양성 샘플로 활용하는 커리큘럼 학습 전략을 적용했다. 이를 통해 모델은 단순한 시각적 일치를 넘어 재질의 의미론적 유사성을 학습한다.

관련 Figure

STT 프레임워크의 전체 파이프라인 다이어그램
Diagram

시각 및 촉각 인코더가 각각 특징을 추출하고 Aligner를 거쳐 공유 공간에서 유사도 맵 M을 생성하는 과정을 보여준다. 재질 다양성 기반 페어링이 학습 데이터 구성에 어떻게 기여하는지 시각화되어 있다.

STT 프레임워크의 전체 파이프라인 다이어그램

주요 결과

TG-Test, Web-Material, OpenSurfaces 세 가지 벤치마크에서 실험을 진행했다. 제안된 STT 모델은 Web-Material 데이터셋에서 60.94 mIoU를 기록하며, 기존 최신 기술인 TVL(32.16 mIoU) 대비 약 2배에 가까운 성능 향상을 보였다.

Ablation Study를 통해 재질 다양성 기반 페어링의 효과를 검증했다. 이 전략을 적용했을 때 Web-Material에서 mIoU가 52.34에서 60.94로 크게 상승했으며, 특히 센서 접촉 초기나 종료 시점의 약한 촉각 신호(Start/End frames)에 대한 국소화 성능이 비약적으로 개선됨을 확인했다.

대화형 국소화(Interactive Localization) 테스트에서도 우수한 성과를 거두었다. 한 이미지 내에 여러 재질이 섞여 있을 때, 입력되는 촉각 신호가 바뀌면 모델이 가리키는 영역도 그에 맞춰 정확하게 이동하는 능력을 입증했다(IIoU 37.0 기록).

관련 Figure

시간 흐름에 따른 촉각 신호 변화와 모델의 국소화 결과 비교
Screenshot

촉각 센서가 물체에 닿고 떨어지는 과정에서 신호 세기가 변함에도 불구하고, 제안된 STT 모델이 다른 변종들보다 일관되게 정확한 영역을 찾아내고 있음을 보여준다.

시간 흐름에 따른 촉각 신호 변화와 모델의 국소화 결과 비교

다양한 벤치마크 데이터셋에서의 정성적 국소화 결과 비교
Photo

기존 방식(TVL)이나 시각 전용 방식(DINOv3 Att. Map)과 비교했을 때, STT가 벽돌, 유리, 식물 등 다양한 재질의 경계를 훨씬 더 정밀하게 구분해냄을 확인할 수 있다.

다양한 벤치마크 데이터셋에서의 정성적 국소화 결과 비교

기술 상세

STT 아키텍처는 DINOv3를 기반으로 하며, 학습 시 시각 백본은 고정(freeze)하고 촉각 백본과 두 모달리티의 Aligner만 최적화한다. 이는 DINOv3가 이미 보유한 강력한 시각적 특징 추출 능력을 보존하면서 촉각 신호를 이에 정렬시키기 위함이다.

수학적으로 유사도 맵 M의 각 원소는 쿼리(촉각)와 키(시각 픽셀) 사이의 코사인 유사도와 유사한 역할을 수행하며, 최종 유사도 점수 s(ft, fv)는 M의 최댓값으로 정의된다. [max(M) → 스칼라 값 → 이미지-촉각 쌍의 전체 유사도 점수].

데이터셋 구축 시 LLM을 활용하여 재질 카테고리별로 풍부한 컨텍스트 쿼리를 생성하고(예: '거실의 벽돌 굴뚝'), 이를 통해 수집된 이미지들을 CLIP 점수 기반으로 필터링하여 고품질의 학습 데이터를 확보했다. 이는 기존 데이터셋의 낮은 시각적 다양성 문제를 해결하는 핵심적인 엔지니어링 기여이다.

한계점

유리컵과 같이 배경이 투명하게 비치는 물체의 경우, 배경의 질감이 강하게 드러나면 세그멘테이션 오류가 발생할 수 있다. 또한, 콘크리트 위에 그려진 로고나 페인트처럼 시각적으로 강한 색상/에지 신호가 실제 재질의 특징을 가리는 경우에도 국소화에 어려움을 겪는다.

실무 활용

로봇 공학 및 증강 현실 분야에서 시각 정보와 촉각 정보를 결합하여 사물을 더 정밀하게 인식하고 조작하는 데 활용될 수 있다.

  • 로봇 재활용 분류 시스템: 카메라로 비춰지는 쓰레기 더미에서 특정 재질(플라스틱, 금속 등)의 영역을 촉각 데이터를 기반으로 정확히 구분
  • 창고 자동화: 360도 카메라 영상에서 특정 재질의 물품을 촉각 센서 신호를 가이드 삼아 국소화 및 피킹
  • 가상 쇼핑/AR: 사용자가 샘플 재질을 만졌을 때, 화면 속 가구의 동일 재질 부분을 하이라이트하거나 재질 변경 시뮬레이션

코드 공개 여부: 공개

코드 저장소 보기

키워드

Tactile Localization(촉각 국소화)Cross-modal Learning(교차 모달 학습)Material Segmentation(재질 세그멘테이션)DINOv3(디노 v3)Contrastive Learning(대조 학습)
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 13.수집 2026. 04. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.