왜 중요한가
일반 중계 영상만으로 탁구공의 3D 위치, 스핀, 선수의 움직임을 정밀하게 복원하는 기술을 제시한다. 기존의 한계를 극복한 Lift-First 접근법을 통해 가림 현상이 심한 상황에서도 물리적으로 타당한 데이터를 대규모로 생성할 수 있어 스포츠 분석과 로봇 학습에 기여한다.
관련 Figure

기존의 2D 기반 분할 방식과 달리 전체 궤적을 먼저 3D로 변환하는 핵심 아이디어를 시각화한다. 이를 통해 가림 현상이 있는 복잡한 경기 장면에서도 정밀한 4D 복원이 가능함을 보여준다.
단안 방송 영상에서 3D 공 궤적, 스핀, 인간 메쉬를 복원하는 Lift-First 파이프라인의 개요도이다.
핵심 기여
Lift-First 재구성 파이프라인
분할되지 않은 2D 공 궤적을 먼저 3D로 복원한 후 시간적 분할을 수행하는 역발상 구조를 통해 가림 현상과 노이즈에 취약했던 기존 2D 기반 분할 방식의 한계를 극복했다.
Full-Sequence Lifting Network
300만 개의 랠리 데이터를 포함한 대규모 합성 데이터셋으로 학습된 Transformer 기반 네트워크로, 긴 시퀀스의 2D 궤적을 입력받아 프레임별 3D 위치와 스핀 벡터를 동시에 예측한다.
TT4D 대규모 멀티모달 데이터셋
140시간 이상의 실제 경기 영상에서 추출된 정밀한 3D 공 궤적, 스핀 정보, 3D 인간 메쉬 데이터를 포함하며, 이는 기존 데이터셋 대비 5배 이상의 규모와 높은 정밀도를 자랑한다.
물리 기반 검증 및 응용
재구성된 데이터의 물리적 타당성을 ODE 피팅으로 검증하고, 이를 활용해 라켓의 타구 시점 포즈 추정 및 생성형 랠리 모델 학습 등 하위 작업에서의 유용성을 입증했다.
핵심 아이디어 이해하기
기존의 스포츠 영상 분석은 '먼저 공을 치는 순간을 찾고(2D 분할), 그 짧은 구간을 3D로 변환(Lifting)'하는 순서를 따랐다. 하지만 탁구공은 너무 작고 빨라 선수 몸에 가려지는 경우가 많아 2D 영상만으로는 분할 지점을 정확히 찾기 어렵다는 근본적인 문제가 있었다.
이 논문은 이 순서를 뒤집어 '전체 2D 궤적을 일단 3D 공간으로 들어 올린(Lift-First) 후, 3D 공간에서 물리 법칙을 이용해 분할 지점을 찾는' 방식을 제안한다. 3D 공간에서는 공의 가속도와 궤적이 물리적으로 명확해지므로 가려진 구간도 더 정확하게 추정할 수 있다는 점에 착안했다.
이를 위해 Transformer 아키텍처를 활용하여 시퀀스 전체의 맥락을 파악한다. Attention 메커니즘이 가려진 프레임 전후의 공 움직임을 참조하여 누락된 위치를 임베딩 공간에서 보간하고, 최종적으로 물리적으로 매끄러운 3D 궤적과 공의 회전(Spin)까지 복원해낸다. 결과적으로 데이터 생성의 자동화 수준을 획기적으로 높여 대규모 고품질 데이터셋 구축을 가능하게 했다.
방법론
전체 파이프라인은 데이터 획득, 3D 리프팅, 도메인 주석 생성, 필터링의 4단계로 구성된다. 핵심인 Full-Sequence Lifting Network는 Transformer 기반으로 설계되어 2D 공 검출 좌표와 카메라 파라미터 정보를 입력받아 3D 좌표와 스핀 벡터를 출력한다.
수학적 모델링 측면에서 공의 비행 궤적은 ma = -kd||v||v + km(ω x v) + g 라는 상미분방정식(ODE)으로 정의된다. [공의 질량과 가속도를 입력으로] → [항력, 마그누스 효과에 의한 힘, 중력을 합산하여] → [순간적인 힘의 변화량을 얻고] → [이를 통해 다음 프레임의 속도와 위치를 예측한다].
학습을 위해 MuJoCo 물리 엔진을 사용하여 300만 개의 가상 랠리 데이터를 생성했다. 특히 'Stitching' 알고리즘을 도입하여 서브부터 리턴까지 이어지는 연속적인 궤적을 합성했으며, Masked Token Modeling 기법을 적용해 실제 영상에서 빈번한 공 검출 누락 상황을 모델이 스스로 복구하도록 학습시켰다.
관련 Figure

입력 영상에서 특징을 추출하고 Full-Rally Ball Uplifting Module을 통해 3D 궤적을 생성하는 과정을 상세히 설명한다. 라켓 접촉 추정기 등 하위 모듈과의 연결 구조를 명확히 제시한다.
데이터 전처리, 3D 리프팅, 주석 생성 및 필터링으로 이어지는 전체 시스템 아키텍처이다.
주요 결과
TT4D 데이터셋은 45,946개의 경기에서 추출된 211,534개의 포인트와 146시간의 플레이 타임을 포함한다. 이는 기존 SOTA 데이터셋인 LATTE-MV(26시간) 대비 약 5.6배 큰 규모이다.
재구성 정밀도 면에서 제안된 Full-Sequence 방식은 기존의 단일 세그먼트 처리 방식 대비 3D 궤적 오차(Δr3D)를 21.71cm에서 18.95cm로 약 12.7% 감소시켰다. 특히 가림 현상이 심한 상황을 가정한 실험(Missing Detections)에서도 3.50px 수준의 낮은 2D 재투영 오차를 유지하며 강건함을 보였다.
물리적 타당성 검증 결과, 재구성된 궤적의 90% 이상이 물리 법칙(ODE)과 10cm 이내의 오차로 일치했다. 또한 생성형 모델인 Flow Matching을 통해 학습된 랠리 데이터는 실제 경기와 유사한 타구 간격 분포와 물리적 궤적 특성을 재현하는 데 성공했다.
관련 Figure

대부분의 데이터가 낮은 RMSE 값을 가져 물리적으로 타당함을 입증한다. 평균 10.35cm의 오차는 고속으로 회전하며 비행하는 탁구공의 특성을 고려할 때 매우 높은 정밀도이다.
재구성된 궤적과 물리 법칙(ODE) 간의 적합도 오차 분포를 나타내는 히스토그램이다.

재구성된 데이터셋이 실제 탁구의 물리적 특성을 잘 반영하고 있음을 보여준다. 특히 탑스핀과 백스핀이 사이드스핀보다 더 넓고 강한 분포를 보이는 실제 경기 양상을 정확히 포착했다.
탑스핀, 백스핀 등 타구 종류별 스핀 강도의 분포를 보여주는 그래프이다.
기술 상세
네트워크 아키텍처는 6개의 Attention Head와 6개의 레이어를 가진 DiT(Diffusion Transformer) 스타일 구조를 채택했다. 입력 단계에서 Disentangled Context Embedding(DCE)을 사용하여 공의 위치 정보와 카메라 파라미터 정보를 분리하여 처리함으로써 모델의 일반화 성능을 높였다.
가변적인 프레임 레이트와 누락된 검출을 처리하기 위해 Rotary Positional Embedding(RoPE)과 Interpolation Token을 사용한다. 특히 Deferred Upsampling Token Attention(DUTA) 메커니즘을 통해 유효한 검출 정보가 누락된 토큰에 의해 오염되는 것을 방지하면서도 주변 맥락 정보를 효과적으로 집계하도록 설계했다.
라켓 상태 추정은 역제어 문제(Inverse Control Problem)로 정형화하여 해결한다. 타구 전후의 공 속도와 스핀 변화를 바탕으로 라켓의 충격량(Impulse)을 계산하고, 이를 통해 라켓의 3D 포즈와 속도를 산출한다. 이 과정은 CasADi 최적화 프레임워크와 IPOPT 솔버를 사용하여 비선형 최적화 문제를 해결함으로써 수행된다.
한계점
서브 전 공을 던지는 동작(Pre-serve ball toss) 구간은 궤적이 불규칙하여 클리핑 및 재구성이 여전히 어려운 단계로 명시되었다. 또한 라켓의 물리적 특성(반발 계수 등)을 고정값으로 가정하고 있어, 실제 다양한 라켓 종류에 따른 미세한 차이를 완벽히 반영하지 못할 수 있다.
실무 활용
이 연구는 일반 중계 영상만으로 고정밀 스포츠 데이터를 추출할 수 있게 하여 전문적인 분석 장비가 없는 환경에서도 데이터 기반 코칭과 로봇 학습을 가능하게 한다.
- 방송 중계 영상을 활용한 선수별 타구 패턴 및 스핀 분석 시스템
- 탁구 로봇의 타구 예측 및 대응 전략 학습을 위한 대규모 시뮬레이션 데이터 공급
- 가상 현실(VR) 기반의 실제 경기 리플레이 및 트레이닝 콘텐츠 제작
코드 공개 여부: 비공개
키워드
용어 해설
- 단안 비디오(Monocular Video)
- — 하나의 카메라 렌즈로 촬영된 일반적인 2D 영상을 의미한다. 깊이 정보가 없는 평면 영상에서 3D 객체의 위치와 움직임을 복원하는 것은 컴퓨터 비전 분야의 난제로 꼽힌다.
- 마그누스 효과(Magnus Effect)
- — 회전하는 물체가 유체 속을 지나갈 때 회전 방향으로 힘을 받아 궤적이 휘어지는 현상이다. 탁구공의 스핀이 비행 궤적과 바운드 지점에 미치는 물리적 영향을 계산하는 데 필수적인 요소이다.
- 시간적 분할(Time Segmentation)
- — 전체 영상 시퀀스에서 특정 이벤트(예: 공을 치는 순간)가 발생하는 시작과 끝 지점을 식별하는 작업이다. 탁구와 같은 고속 스포츠에서는 가림 현상 때문에 2D 기반 분할이 매우 어렵다.
- 로터리 위치 임베딩(RoPE)
- — Transformer 모델에서 토큰의 상대적 위치 정보를 주입하는 기법이다. 프레임 레이트가 가변적이거나 누락된 프레임이 있는 시퀀스에서도 정확한 시간적 맥락을 유지할 수 있게 돕는다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.