본문으로 건너뛰기

촉각과 힘까지 기록한 HOI 조작 데이터셋

HOI 데이터셋이 시각·촉각·힘 센서로 조작 정보를 기록합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

영상만으로는 사람이 서랍을 당길 때 발생한 힘과 손끝 접촉을 알기 어렵다는 문제를 해결하기 위해, ETH Zurich의 HOI 데이터셋은 6축 force-torque sensor, 양쪽 GelSight 촉각 이미지, 사람과 gripper 카메라를 밀리미터 단위 레이저 스캔 공간에 정합했습니다. 맨손, UMI gripper, 계측형 gripper가 같은 서랍과 문을 조작한 기록으로 embodiment 변화에 따른 정보 전달을 비교할 수 있습니다. 게시자는 CVPR 2026 공개본의 3,048개 시퀀스 중 88개 에피소드를 MCAP으로 패키징해 FiftyOne에서 힘 그래프, 촉각 이미지, 두 카메라 영상을 하나의 타임라인으로 탐색하도록 제공했습니다.

실용적 조언

  • HOI 데이터셋을 살펴볼 때는 동일한 조작 장면에서 카메라 영상만 볼 때와 force-torque·GelSight 기록을 함께 볼 때의 정보 차이를 비교하는 방식이 적절합니다. 게시자가 제공한 FiftyOne Space에서는 힘 그래프와 촉각 이미지, 두 카메라 뷰를 같은 타임라인에 맞춰 확인할 수 있습니다. 먼저 88개 MCAP 에피소드와 embodiment별 저장 뷰를 활용하면 센서 구성이 행동 기록에 미치는 차이를 빠르게 확인할 수 있습니다.

섹션별 상세

01
사람이 서랍을 여는 영상을 대량으로 학습한 정책은 손이 얼마나 세게 당겼는지 알기 어렵다는 문제가 제기됩니다. 영상은 손의 움직임은 기록하지만 손이 느낀 접촉력 자체를 기록하지 않기 때문입니다. HOI 데이터셋은 이 빈틈을 힘과 촉각 센서 기록으로 보완해 시각 정보와 물리적 상호작용의 차이를 연구할 수 있게 합니다.
02
ETH Zurich의 계측형 gripper는 6축 force-torque sensor를 100Hz로 구동하고 양쪽 손가락에 GelSight 촉각 카메라를 장착했습니다. 사람의 안경과 gripper 자체에도 카메라를 설치한 뒤 모든 기록을 방의 밀리미터 단위 레이저 스캔에 정합했습니다. 같은 서랍, 냉장고, 캐비닛 문을 맨손, UMI gripper, 계측형 gripper로 조작해 embodiment가 달라질 때 어떤 조작 정보가 전달되는지 비교하는 구조입니다.
03
게시자는 CVPR 2026 공개본의 3,048개 시퀀스 중 88개 에피소드를 MCAP으로 묶어 FiftyOne에서 바로 탐색할 수 있도록 했습니다. 브라우저 화면에서는 힘 그래프와 양쪽 카메라 영상, 촉각 이미지를 하나의 타임라인에서 이동시키고 embodiment별 저장 뷰를 불러올 수 있습니다. 별도 설치 없이 센서 간 시간 관계와 조작 장면을 함께 확인할 수 있다는 점이 데이터셋 접근성을 높입니다.

이미지 분석

3D 점군 공간에서 사람과 gripper의 궤적을 구분하고 센서 기록을 시간축으로 탐색하는 FiftyOne 화면입니다.
Screenshot

화면 중앙에는 방과 가구를 재구성한 3D 점군이 있고, 오른쪽에는 aria_human/trajectory와 aria_gripper/trajectory 같은 궤적 항목이 표시됩니다. 아래 타임라인은 약 8초 길이의 에피소드를 구간별로 이동하게 하며, 게시자가 말한 embodiment별 센서·카메라 기록을 브라우저에서 동기화해 확인하는 용도와 연결됩니다.

3D 점군 공간에서 사람과 gripper의 궤적을 구분하고 센서 기록을 시간축으로 탐색하는 FiftyOne 화면입니다.

FiftyOne의 3D 점군 뷰와 사람·gripper 궤적 레이어, 에피소드 타임라인을 함께 담은 정지 화면입니다.
Screenshot

정지 화면에서도 레이저 스캔 기반 공간 표현과 사람·gripper의 궤적 레이어가 분리되어 나타납니다. 이 구성은 조작 영상을 단순 재생하는 대신 공간 위치와 시간축을 함께 확인하도록 하며, 게시자가 소개한 HOI 에피소드 탐색 인터페이스의 핵심 요소를 담고 있습니다.

FiftyOne의 3D 점군 뷰와 사람·gripper 궤적 레이어, 에피소드 타임라인을 함께 담은 정지 화면입니다.

용어 해설

힘-토크 센서(Force-Torque Sensor)
힘-토크 센서는 물체를 잡거나 당길 때 발생하는 힘과 회전 토크를 측정하는 센서입니다. 이 데이터셋에서는 6축 센서가 100Hz로 그리퍼에 가해지는 물리적 상호작용을 기록해 영상만으로 알기 어려운 조작 강도를 보완합니다.
GelSight 촉각 영상(GelSight Tactile Imaging)
GelSight 촉각 영상은 손가락 끝의 접촉면 변형을 이미지로 기록하는 방식입니다. 양쪽 손가락에 장착된 센서가 물체와 접촉하는 위치와 표면 반응을 시각 정보로 남겨 힘 센서와 함께 조작 과정을 재구성합니다.
MCAP 데이터 형식(MCAP)
MCAP은 여러 센서와 카메라에서 나온 시계열 데이터를 하나의 기록 파일로 묶는 형식입니다. 게시자는 HOI 데이터셋의 88개 에피소드를 MCAP으로 패키징해 힘 그래프, 촉각 영상, 카메라 영상을 같은 타임라인에서 탐색하도록 구성했습니다.
구현체(Embodiment)
Embodiment는 동일한 작업을 수행하는 주체의 신체적 형태와 센서 구성을 뜻합니다. 이 데이터셋은 맨손, UMI gripper, 계측형 gripper가 같은 서랍과 냉장고 문을 조작한 기록을 비교해 신체가 바뀔 때 어떤 정보가 전달되는지 연구할 수 있게 합니다.
레이저 스캔 정합(Laser Scan Registration)
레이저 스캔 정합은 센서와 카메라의 관측을 실제 공간의 정밀한 3차원 기준 좌표에 맞추는 과정입니다. HOI 기록은 방을 밀리미터 단위로 측정한 레이저 스캔에 각 센서 데이터를 등록해 사람과 그리퍼의 움직임을 같은 공간에서 비교합니다.

언급된 도구

fiftyone추천링크

88개 에피소드의 MCAP 기록을 브라우저에서 탐색하고 힘 그래프, 촉각 이미지, 카메라 영상을 하나의 타임라인으로 동기화합니다.

MCAP중립

HOI 데이터셋의 센서와 카메라 시계열을 에피소드 단위로 패키징합니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 26.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.