TL;DR
시각만으로는 마찰력이나 강성 같은 물리적 특성을 정확히 추론하기 어려워 로봇 조작에 한계가 존재했다. Splash는 소형 MLLM 내부의 덜 중요한 파라미터만 재활용해 촉각 정보를 내장함으로써 추가 추론 비용 없이 촉각 기반 언어 추론 능력을 확보했다. 이 접근은 연산 제약이 큰 엣지 로봇 환경에서 감각 확장과 기존 지식 보존을 동시에 달성할 수 있음을 시사한다.
왜 중요한가
시각만으로는 마찰력이나 강성 같은 물리적 특성을 정확히 추론하기 어려워 로봇 조작에 한계가 존재했다. Splash는 소형 MLLM 내부의 덜 중요한 파라미터만 재활용해 촉각 정보를 내장함으로써 추가 추론 비용 없이 촉각 기반 언어 추론 능력을 확보했다. 이 접근은 연산 제약이 큰 엣지 로봇 환경에서 감각 확장과 기존 지식 보존을 동시에 달성할 수 있음을 시사한다.
핵심 기여
시각 상대 중요도 기반 휴면 부분공간 탐지
사전학습된 선형층의 각 가중치에 대해 가중치 절대값과 해당 입력 활성화의 ℓ2 노름을 곱한 시각 상대 중요도를 계산했다. 층별 임계값을 설정해 중요도가 낮은 파라미터를 휴면으로 표시하는 이진 마스크를 구성했다. 이 마스크는 입력-출력 접지와 최상위 블록을 보호하도록 설계되어 학습 안정성을 확보했다.
마스크 격리 학습으로 촉각 적응과 비파괴적 보존의 단일 단계 통합
마스크로 구분된 휴면 영역만 경사 업데이트 대상이 되도록 하여 촉각 프론트엔드와 LLM의 휴면 서브스페이스를 동시에 학습했다. 중요한 파라미터는 동결되어 시각-언어 추론 경로가 훼손되지 않았다. 이 단일 단계 훈련은 기존의 다단계 정렬 절차와 비교해 파이프라인을 단순화하고 추가 추론 오버헤드를 제거했다.
소형 MLLM에서의 SOTA 성능과 보존 능력 입증
Qwen2.5-VL-3B 및 InternVL2.5-1B 기반 실험에서 Splash -3B는 SSVTP, TVL, TacQuad에서 높은 촉각 언어 성능을 달성했다. 동시에 MMMUval, MathVista 등 일반 비전-언어 벤치마크에서 기존 LoRA 기반 적응보다 우수하거나 유사한 성능을 유지했다. 이 결과는 소형 모델의 용량을 비파괴적으로 확장할 수 있음을 보여주었다.
캘리브레이션 데이터에 강건한 마스크 설계
CC3M 기반의 소규모 캘리브레이션(예: 128샘플)으로도 유의미한 중요도 스코어를 산출하여 마스크를 형성했다. 캘리브레이션 데이터셋 변경이나 노이즈(언페어드) 설정에서도 전체 성능이 크게 저하되지 않았다. 이는 구조적 중복성에 기반한 마스크가 특정 데이터셋에 과도하게 의존하지 않음을 의미한다.
핵심 아이디어 이해하기
대형 언어 모델의 파라미터 공간에는 기능적으로 중요한 부분과 상대적으로 덜 사용되는 부분이 공존한다는 자연 희소성 가정이 출발점이다. 이 논문은 입력 활성화 통계와 가중치 크기를 결합한 시각 상대 중요도 지표로 각 파라미터의 VL 기여도를 수치화했다. 중요도가 낮은 파라미터를 휴면 서브스페이스로 간주하면 새로운 촉각 능력을 그 서브스페이스에만 할당해 기존 시각-언어 경로를 보존할 수 있다.
방법론
전체 아키텍처는 자연 이미지 프론트엔드, 촉각 프론트엔드(Imagenet-pretrained ViT-Tiny), 그리고 시퀀스 기반의 LLM으로 구성된다. 입력은 자연 이미지, 접촉 이미지, 텍스트 프롬프트를 토크나이저로 합쳐 단일 자기회귀 시퀀스로 처리되며 출력은 촉각 속성 서술이다. 휴면 서브스페이스 탐지는 소량의 VL 캘리브레이션 샘플로 각 선형 연결의 중요도를 계산한 뒤 층별 임계값으로 이진 마스크를 생성하는 절차로 이루어진다.
관련 Figure

이 그림은 파라미터 중요도 산출식과 층별 임계값으로 이진 마스크를 구성해 휴면 공간을 확보하는 과정을 시각적으로 요약한다. 또한 촉각 프론트엔드와 휴면 서브스페이스를 단일 단계로 학습하는 구성을 보여줘 추가 모듈이나 추론 오버헤드가 없음을 강조한다. 전체 구조는 마스크 적용 위치와 동결 대상 레이어를 명확히 표현해 방법론의 핵심 설계 결정을 보강한다.
Splash의 전체 파이프라인을 나타내는 다이어그램으로, 시각·촉각 프론트엔드와 LLM 내부의 휴면/중요 서브스페이스 분할 및 마스크 기반 학습 흐름을 제시한다.
주요 결과
정량 평가에서 Splash -3B는 VTL 평균 점수 4.91을 기록하며 동일 백본에서 LoRA 기반 TVL(4.50)보다 높은 촉각-언어 성능을 보였다. VL 보존 측면에서는 Splash -3B가 MMMUval을 50.0에서 55.3으로, MathVista를 62.3에서 65.3으로 향상시키며 촉각 적응이 시각-언어 능력을 훼손하지 않음을 실증했다. 희소성 비율 실험에서 s=60%가 촉각 성능과 VL 보존 사이의 가장 좋은 균형을 제공함이 확인되었다.
관련 Figure

그래프는 UniTouch, TVL 기반 LoRA, SPLASH 계열의 모델을 F1과 Top-5 Accuracy로 비교해 Splash의 우수성을 정량적으로 드러낸다. 각 모델의 두 지표를 나란히 보여줘 촉각 속성 예측의 정확도와 다양성 측면에서의 균형을 평가할 수 있게 한다. 이 시각자료는 본문의 수치적 주장(예: Splash -3B의 F1/Top-5 우위)을 직접적인 근거로 보완한다.
여러 방법들의 F1 점수와 Top-5 정확도를 비교한 막대그래프로, Splash가 다른 백본과 적응 방식 대비 우수한 객관적 메트릭을 기록한 결과를 요약한다.

이 그림은 모델별 출력 문장을 나열하고 LLM 판정 점수를 표기해 정성적 차이를 보여준다. 특히 시각적 단서만으로 잘못된 촉각 용어를 출력하는 사례와 Splash가 접촉 이미지를 통합해 더 정확한 속성 표현을 생성한 사례를 비교해준다. 정성 예시는 정량지표가 포착하지 못하는 오류 유형과 문장 수준의 일관성을 파악하는 데 도움을 준다.
TVL/SSVTP 예시에서 자연 이미지와 접촉 이미지 쌍을 입력으로 각 모델이 생성한 촉각 서술과 GPT-4o 기준 점수를 비교한 정성적 예시 모음이다.

이 그림은 물체별로 UniTouch, TVL-LLaMA, SPLASH 1B/3B의 예측을 비교해 작은 모델에서도 Splash가 더 일관되게 정확한 속성 단어를 생성함을 보여준다. 각 사례는 접촉 이미지의 색/패턴 특성이 촉각 표현에 어떤 영향을 미치는지와 모델의 취약점을 드러낸다. 이러한 사례들은 본문의 주장인 '비파괴적 촉각 확장'과 '시각-촉각 통합의 실효성'을 보강하는 정성 근거로 작동한다.
다양한 물체 표면에 대해 모델들이 생성한 촉각 속성 예측과 정답 라벨을 나란히 보여주는 추가 정성 결과로, 모델별 점수와 예측의 세부 차이를 제시한다.

이 그림은 시간적 궤적에서 중간 프레임을 대표 관측으로 사용해 TacQuad의 복잡한 접촉 동작에 대한 모델의 반응을 보여준다. Splash의 출력이 더 다양한 촉각 속성과 높은 판정 점수를 얻는 경향이 있어 분포 이동에 대한 일반화 능력을 시사한다. 또한 사례별 오답 유형을 통해 향후 동적 마스크나 센서 다양화가 필요한 실무적 한계를 시각적으로 드러낸다.
TacQuad의 사례들을 보여주는 정성적 비교로, 접촉 장면 사진과 센서 이미지, 모델 예측 및 GPT-4o 기반 정성 점수가 포함되어 있다.
기술 상세
파라미터 분할은 각 선형층의 연결별 점수 S_{i,j}=|W_{i,j}|·||x_i||_2로 정의되며, 층별 임계값 τ_j(s)를 정해 하위 s%의 점수를 휴면으로 표시한다. 마스크 M은 첫 번째와 마지막 트랜스포머 블록의 파라미터를 항상 동결하도록 설계하여 입력 접지와 고수준 표현을 보존한다. 학습은 촉각 프론트엔드의 모든 파라미터와 마스크로 허용된 LLM 휴면 파라미터만 업데이트하는 방식으로 진행되며 업데이트 식은 θ ← θ − η (M ⊙ ∇_θ L), ψ ← ψ − η ∇_ψ L로 수학적으로 표현된다.
한계점
현재 마스크 분할은 오프라인 캘리브레이션 단계에서 정적 마스크를 생성하는 방식이라 상호작용 상태에 따라 활성화 패턴이 변하는 장기적인 작업에서는 최적이 아닐 수 있다. 또한 실험은 DIGIT 센서 기반 데이터셋에 집중되어 있어 다른 유형의 촉각 센서로의 직접 전이성은 추가 검증이 필요하다. 논문은 동적 마스킹과 센서 간 일반화 연구를 향후 과제로 명시했다.
실무 활용
Splash는 엣지 제약이 있는 로봇에 촉각 정렬 능력을 추가할 때 유용한 접근법이다. 사전학습된 소형 MLLM을 그대로 유지하면서 휴면 파라미터만 재활용하므로 추가 추론 비용이 발생하지 않는다. 공개된 코드와 사전학습 백본을 결합하면 실제 로봇의 촉각-언어 태스크에 적용 가능하다.
- 로봇의 물체 조작에서 접촉 지점의 재질 특성(예: 거칠기, 단단함)을 자연어로 추론하는 시나리오에서 활용할 수 있다.
- 제한된 하드웨어 자원으로 구동되는 휴대형 검사 장비에 촉각 센서를 추가하여 시각으로 구분하기 어려운 표면 특성을 판독하는 용도로 적용할 수 있다.
- 촉각 데이터가 드물거나 도메인 변동이 큰 환경에서 소형 MLLM의 기능을 비파괴적으로 확장해 사용자 인터랙션 기반 애플리케이션을 개선하는 데 사용될 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Dormant Subspace
- — 사전학습된 모델 내부에서 시그널에 덜 민감해 별다른 기능을 수행하지 않는 파라미터 집합을 의미한다. 본문에서는 시각-언어 성능 보존을 위해 이 집합만 선택적으로 갱신하여 촉각 적응을 수행한다. 휴면 부분공간을 재활성화하면 전체 모델 구조를 유지하면서 새로운 모달리티 용량을 확보할 수 있다.
- Visual-Relative Importance
- — 사전학습된 시각-언어 동작에 기여하는 각 가중치의 중요도를 가중치 크기와 해당 입력 활성화의 ℓ2 노름 곱으로 측정한 지표이다. 이 값이 낮은 파라미터를 휴면으로 간주해 촉각 학습 시 업데이트 허용 여부를 결정한다. 간단한 캘리브레이션 세트로 층별 임계값을 정해 마스크를 구성한다.
- Mask-Isolated Tactile Alignment
- — LLM의 파라미터를 중요도 기반으로 이원화한 뒤, 중요도가 낮은 휴면 영역만 업데이트하여 촉각 전용 표현을 내장시키는 학습 방식이다. 임계값 기반 마스크를 적용해 중요한 가중치는 동결하고 휴면 가중치만 경사 하강으로 갱신한다. 이 방식은 파괴적 재학습을 억제해 비파괴적 모달리티 확장을 달성한다.
- DIGIT Sensor
- — 작고 고해상도의 광학식 촉각 센서로, 접촉 시 표면 형상과 미세 텍스처를 시각적 이미지 형태로 캡처한다. 본 연구의 촉각 데이터는 DIGIT로 수집된 접촉 이미지 쌍을 기반으로 구성되어 촉각 프론트엔드 학습에 사용된다. 센서 특유의 색보정 및 조명 효과가 데이터 특성에 영향을 준다.
- ViT-Tiny
- — Vision Transformer의 경량 변형으로 패치 크기 16×16을 사용해 적은 파라미터로 이미지의 기하학적 특징을 추출한다. 본문에서는 촉각 접촉 이미지에서 기하학 특성을 뽑는 촉각 프론트엔드로 ViT-Tiny를 사용해 파라미터 부담을 낮추었다. 추출된 특징은 MLP 프로젝터를 거쳐 LLM의 임베딩 공간으로 매핑된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


