본문으로 건너뛰기
r/computervision조회 4

대회 영상에서 YOLO·ByteTrack·Hilbert transform·TCN으로 트릭라인 선수의 바운스와 회전 기술을 자동 판별하는 파이프라인

YOLO 기반 포즈 추적과 ByteTrack 트래킹으로 선수 궤적을 확보하고 Hilbert transform으로 바운스 경계를 찾은 뒤 TCN으로 트릭을 분류하는 파이프라인이 초기 공통 트릭에서 괜찮은 성능을 보였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

트릭라인 경기에서 심판이 빠른 연속 회전 동작을 실시간으로 식별하기 어려운 문제를 해결하기 위해 작성자는 YOLO 기반 포즈 검출과 ByteTrack 트래킹으로 단일 선수의 프레임 시퀀스를 확보하고, 선수의 세로 위치 신호에 Hilbert transform을 적용해 바운스 위상을 추출함으로써 실측 바운스 경계로 영상을 분할했다. 분할된 바운스 세그먼트에는 Temporal Convolutional Network를 적용해 각 세그먼트의 트릭 라벨을 예측했고 초기 공통 트릭에서 괜찮은 성능이 보고되었다. 시스템은 Streamlit 기반의 사람-in-the-loop 인터페이스와 TJS 이벤트 플랫폼과 연동되어 현장 라벨링과 점진적 학습 루프를 지원하며, 댓글에서는 더 다양한 트릭 데이터 수집과 실시간 처리 견고성 개선 방안이 주요 논점으로 제기되었다.

실용적 조언

  • 실무적으로는 우선 공통 트릭에 대해 충분한 라벨링을 집중적으로 수행해 기본 분류 성능을 확보한 뒤 드문 트릭에 대해 점진적 학습을 적용하라는 권고가 있었다. 데이터 불균형 해결을 위해 증강 기법과 합성 데이터 생성 가능성을 검토하라는 권고가 제시되었고, 실시간 적용을 위해서는 트래킹 단계에서의 경량화와 TCN 입력 윈도 크기 튜닝으로 지연을 줄이라는 구체적 조언이 함께 제시되었다. 또한 사람-in-the-loop 인터페이스를 통해 오탐을 빠르게 교정하고 재학습 루프를 돌리는 운영 방안이 실무적 효용을 갖는다는 의견이 많았다.

섹션별 상세

01
경기 심판이 초고속 회전 동작을 실시간으로 식별하고 채점하는 데 어려움이 있다는 문제의식이 이 프로젝트의 출발점이었다. 영상 입력에서 선수의 프레임별 포즈를 얻고 이를 ID로 연속 연결해 단일 선수 시퀀스를 만드는 단계가 초기 처리 흐름이었다. 게시글 작성자는 이 처리 과정을 YOLO 포즈 검출기와 ByteTrack 연결로 구현했고 그 결과를 바탕으로 이후 신호 처리 및 분류 단계로 전달한다고 보고했다.
02
선수 추적과 포즈 필터링은 입력 프레임에서 관심 객체만 남기고 나머지를 제거하는 역할을 수행했다. YOLO11x-pose로 프레임별 관절 좌표를 얻은 뒤 ByteTrack으로 각 프레임의 검출을 시간적으로 연속시키며 잘못 연결된 ID를 제거하는 추가 처리로 단일 선수의 포즈 시퀀스를 확보했다. 해당 단계의 산출물이 바운스 검출과 트릭 분류의 핵심 입력 데이터로 활용되며, 게시글에는 포즈 누락에 견고하게 동작하도록 필터링 로직을 더했다고 기술되어 있다.
03
바운스 경계 검출은 선수의 수직 이동 신호를 시간 도메인에서 처리해 이루어졌다. 작성자는 세로 위치 신호에 Hilbert transform을 적용해 순간 진폭과 위상 정보를 얻고 이를 통해 바운스의 위상(상승-하강-최저점)을 추출해 실측 바운스 경계로 비디오를 분할한다고 밝혔다. 이 방식은 포즈가 일시적으로 누락되더라도 위상 기반 경계 추론으로 경계 일관성을 유지할 수 있다는 근거를 제공한다.
04
트릭 인식은 분할된 바운스 세그먼트에 대해 Temporal Convolutional Network(TCN) 분류기를 적용해 수행되었다. 입력으로는 프레임별 관절 좌표 또는 운동 수치가 들어가고 TCN은 시간적 필터를 통해 회전·도약 패턴을 학습해 각 세그먼트의 라벨을 예측한다. 작성자는 초기 공통 트릭에서 성능이 '꽤 괜찮다'고 보고했으며 추가 데이터 수집과 사람-in-the-loop 라벨링으로 데이터셋과 성능을 점진적으로 개선하고 있다고 적었다.

이미지 분석

상단에는 포즈 스켈레톤이 오버레이된 경기 프레임이 있고 하단에는 프레임별 세로 위치 신호와 바운스 경계가 시각화된 차트가 함께 배치되어 있다.
Chart

이미지는 포즈 기반 추적 결과와 신호 처리 기반 바운스 검출이 어떻게 결합되는지를 시각적으로 제시한다. 상단 프레임은 특정 선수의 관절 좌표에 대한 포즈 오버레이를 보여주며 하단 차트는 Y 축(수직 위치) 변동과 프레임 인덱스를 통해 반복적인 바운스 패턴과 분할된 세그먼트를 나타낸다. 이 구성이 파이프라인의 입력(포즈), 중간(바운스 경계), 출력(트릭 세그먼트 라벨링) 흐름을 직관적으로 전달한다.

상단에는 포즈 스켈레톤이 오버레이된 경기 프레임이 있고 하단에는 프레임별 세로 위치 신호와 바운스 경계가 시각화된 차트가 함께 배치되어 있다.

용어 해설

포즈 추정(Pose Estimation)
비디오 또는 이미지에서 사람의 관절 좌표를 픽셀 기반으로 추출하는 기술로, 관절 좌표는 프레임별로 사람의 신체 위치와 자세 변화를 수치화하는 입력이 된다. 이 글에서는 YOLO 기반 포즈 검출 결과를 트래킹과 결합해 특정 선수의 동작을 프레임 단위로 분리하는 데 사용되며, 이후 바운스 경계 검출과 트릭 분류의 기초 입력이 된다.
다중 객체 추적(Multi-Object Tracking)
연속 프레임에서 동일 객체의 위치를 일관되게 식별하고 ID를 유지하는 과정으로, 검출기(예: YOLO)의 프레임별 출력에 대해 연결 알고리즘(ByteTrack 등)을 적용해 선수의 프레임별 궤적을 생성한다. 이 파이프라인에서는 한 경기 영상에서 관심 선수만 남기기 위한 필터링과 누락 보정에 핵심 역할을 한다.
힐베르트 변환(Hilbert Transform)
신호의 즉각적인 진폭과 위상 정보를 추출하기 위해 실신호에 대해 해석 신호를 만드는 연산으로, 세로 방향 운동 신호에서 바운스 위상(상승·하강·최저점)을 분리해 정확한 바운스 경계를 결정하는 데 사용된다. 이 절차는 포즈 누락이 있어도 위상 기반으로 바운스 경계를 찾도록 견고성을 제공한다.
시간적 합성곱 신경망(Temporal Convolutional Network)
시간 축을 따라 1차원 합성곱을 적용해 시퀀스 패턴을 학습하는 구조로, 프레임 시퀀스에서 동작의 시간적 특징을 포착해 복잡한 회전·도약·회전 연속 동작을 분류하는 데 사용된다. 이 글에서는 각 트릭의 시작과 끝이 정해진 세그먼트에서 TCN 기반 분류기가 레이블을 예측하는 용도로 활용되었다.

언급된 도구

YOLO추천

프레임별 사람 포즈 검출

ByteTrack추천

프레임 간 검출 결과를 연결해 선수 ID를 유지하는 트래킹

TCN중립

시간적 패턴을 학습해 바운스 세그먼트의 트릭을 분류

Streamlit추천링크

사람-in-the-loop 라벨링과 데모 실행을 위한 간단한 웹 인터페이스

TJS (slackline-tjs.com)중립링크

트릭라인 이벤트·심사·라이브스트리밍 플랫폼으로 파이프라인과 연동된 운영 환경

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 24.수집 2026. 07. 24.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.