본문으로 건너뛰기

데이터 정비로 성능 회복한 RT‑DETR‑S 현장 노트

iPhone 영상으로 주로 학습된 RT‑DETR‑S가 Reolink 카메라에서 실패했으며 센서 불일치와 하드코딩된 클래스 인덱스, 라벨 정비로 재학습해 최종 mAP50 99.3%를 달성했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

실제 프로젝트에서 RT‑DETR‑S가 초기 홀드아웃에서 높은 수치를 보였지만 주로 iPhone 영상으로 학습된 탓에 Reolink 카메라에서 실패했고, 하드코딩된 클래스 인덱스 오류와 라벨 품질 문제까지 겹쳐 정상 동작이 불가능했다. 진단 과정에서 클래스 매핑 오류는 세 줄의 코드로 수정되었고 센서 불일치를 해소하기 위해 모든 프레임을 Reolink로 수집해 네거티브 마이닝으로 장식 보드들을 '배경'으로 라벨링한 뒤 재학습을 수행했다. 최종 v15 데이터셋(505프레임, 195수작업 주석)으로 재학습한 결과 99.3% mAP50를 달성했고 본문에서는 데이터 정비만으로 37퍼센트포인트 개선이 있었다고 보고되어 데이터 위생과 센서 매칭이 성능 개선의 핵심임이 확인되었다.

실용적 조언

  • 배포 전에 반드시 학습 데이터가 실제 배포 센서의 특성을 반영하는지 확인해야 한다. 센서별 색감·노출·해상도 차이가 특징 추출 단계에 영향을 미치므로 배포 카메라에서 직접 수집한 예시를 충분히 포함하는 것이 중요하다. 또한 데이터 수집 비율을 명시적으로 관리해 특정 센서에 대한 대표성이 확보되도록 해야 한다.
  • 라벨과 클래스 인덱스의 정합성 검증을 자동화해 인덱스 반전 같은 운영 오류를 사전 차단해야 한다. 출력 인덱스와 라벨 매핑을 테스트하는 스모크 테스트를 도입하면 몇 줄의 하드코딩 오류가 나흘간의 디버깅으로 번지는 일을 예방할 수 있다. 테스트는 샘플 입력을 통해 예측 라벨이 기대값과 일치하는지 검증하는 방식으로 구현하면 된다.
  • 오탐을 유발하는 배경 요소에 대해 네거티브 마이닝을 수행하고 해당 예시를 '배경'으로 라벨링해 재학습하는 과정이 효과적이다. 문제를 일으키는 변이(장식 보드 등)를 수집해 별도 파이프라인으로 라벨링하고 모델을 재학습하면 실제 운영 환경에서의 민감도를 낮출 수 있다. 데이터 변경 후에는 성능 지표(mAP50 등)를 재측정해 개선 효과를 수치로 검증해야 한다.

섹션별 상세

01
학습 데이터와 배포 센서 간 도메인 불일치가 실제 동작 실패의 핵심 원인이었다는 문제가 제기되었다. 입력으로는 iPhone 촬영 영상이 주로 사용되었고 처리 단계에서 Reolink 프레임의 색감·노이즈·해상도 차이가 특징 추출에 영향을 미쳐 출력으로는 전혀 다른 검출 결과가 나타났다. 글에는 전체 학습 이미지 수 4,148장 가운데 배포 센서에서 온 것은 42장뿐이었다는 수치가 제시되어 도메인 불일치의 규모가 명확히 드러났다. 이로 인해 모델이 데모 환경에서 작동하지 않아 센서 매칭과 데이터 수집의 우선성을 확인하게 되었다.
좌측에는 흩어진 오렌지 점들이, 우측에는 센서별로 원 안에 모여 있는 파란 점들이 대비된 다이어그램과 아래에 성능을 나타내는 막대가 배치되어 있다.
Diagram이미지는 학습 데이터의 분포와 배포 센서별 군집을 시각적으로 대비해 도메인 불일치 문제를 나타내고 있다. 좌측의 산발적 점군은 혼합되거나 균일하지 않은 학습 샘플을 암시하며 우측의 원형 군집은 센서별 특성을 반영한 그룹化를 의미한다. 하단의 서로 다른 길이 막대는 센서 매칭과 데이터 정비 전후의 성능 차이를 시사하는 시각적 근거로 활용될 수 있다.
02
하드코딩된 클래스 인덱스 매핑이 실제 검출을 완전히 뒤바꾸는 결함으로 작동한 사례가 보고되었다. 모델 출력 인덱스와 라벨 대응을 오래된 모델의 매핑으로 고정해 두었기 때문에 처리 단계에서 예측 인덱스가 잘못 해석되어 출력으로는 가방을 구멍으로, 구멍을 가방으로 판단하는 반전 현상이 발생했다. 이 버그는 수정 자체는 세 줄의 코드로 해결되었지만 원인 규명에만 나흘이 소요되었다는 구체적인 운영 사례가 포함되어 있어, 작은 매핑 오류가 큰 기능 장애로 이어짐을 실증했다. 이 사례는 배포 전 기본적인 라벨-인덱트 일치 검증을 자동화해야 한다는 실무적 교훈을 남겼다.
03
레이블 품질과 네거티브 샘플의 부족이 높은 성능 수치에도 불구하고 실제 성능을 심각하게 저해한 요소로 파악되었다. 장식이 들어간 보드(플로럴 랩, 스폰서 로고 등)가 모델의 오탐을 유발해 해당 장면을 명확히 '배경'으로 라벨링하는 네거티브 마이닝을 수행했고, 그 결과 재학습 시 오탐률이 크게 줄어들었다. 최종 v15 데이터셋은 505프레임으로 구성되었고 그중 195프레임이 수작업 주석 처리되었으며 모든 프레임이 Reolink에서 수집되었다는 수치 근거가 제시되어 데이터 보강의 구체적 작업량이 확인된다. 이 작업 이후 모델 성능은 99.3% mAP50에 도달했고 본문에서는 데이터 정비만으로 37퍼센트포인트 개선이 있었다고 명시되어 데이터 위생의 영향력이 수치로 뒷받침되었다.
04
운영 규칙과 우선순위 변경이 실무적으로 제안되었다는 합의가 도출되었다. 구체적으로 아키텍처 변경을 고려하기 전에 데이터셋을 먼저 점검하고, 에포크 수를 늘리기 전에 라벨을 감사하며, 추가 데이터를 투입하기 전에 기존 데이터가 배포 센서와 일치하는지를 검증해야 한다는 절차가 성문화되었다. 이 규칙들은 성능 상한이 모델 구조보다 데이터 일치성이나 라벨 품질에 의해 좌우되는 경우가 많음을 경험적으로 반영한 것으로, 배포 성공률을 높이기 위한 프로세스 개선을 의미한다.

용어 해설

mAP50
객체 검출 성능을 평가하는 지표로, IoU(Intersection over Union) 임계값 0.5에서의 평균 정밀도를 계산한 값이다. 여러 클래스에 대해 Precision-Recall 곡선을 그려 평균을 내며 모델의 검출 정확도를 수치로 표현한다. 이 글에서는 초기 성능과 최종 성능을 비교하는 핵심 지표로 사용되었다.
도메인 쉬프트(Domain Shift)
학습 데이터와 배포(운영) 데이터의 입력 분포가 달라져 모델 성능이 저하되는 현상이다. 카메라 기종·해상도·노출·색감 차이 등이 원인이며, 감지 입력이 다르면 특징 추출 단계에서 불일치가 발생한다. 본 사례에서는 iPhone 영상으로 학습된 모델이 Reolink 프레임에서 실패한 원인으로 작동했다.
네거티브 마이닝(Negative Mining)
모델이 오탐을 내는 배경이나 유사 객체를 의도적으로 수집해 '배경'으로 라벨링하고 재학습하는 과정이다. 잘못 분류되는 사례를 포함해 모델이 오탐을 구별하도록 학습 데이터의 음성 예시를 보강한다. 본 사례에서는 장식된 보드 프레임을 네거티브 샘플로 수집해 오탐을 줄였다.
홀드아웃 세트(Holdout Set)
학습 중에 사용하지 않고 최종 성능을 평가하기 위해 분리해 둔 검증용 데이터셋이다. 모델 튜닝이나 하이퍼파라미터 선택에 직접 사용되지 않아 과적합을 평가하는 기준이 된다. 본 글에서는 초기 97.8% mAP가 홀드아웃 세트에서 산출된 수치로 언급되었다.
클래스 인덱스 매핑(Class Index Mapping)
모델 출력 인덱스와 실제 라벨 클래스가 일치하도록 대응시키는 규칙이나 테이블이다. 매핑이 하드코딩되거나 잘못 정의되면 예측 클래스가 뒤바뀌는 오류가 발생한다. 본 사례에서는 하드코딩된 매핑 때문에 '가방'과 '구멍' 클래스가 반전되어 검출이 잘못 나왔다.

언급된 도구

RT-DETR-S중립

객체 검출을 수행하는 비전 모델

Reolink중립

배포에 사용된 보안/상용 카메라 센서

iPhone중립

주로 학습 데이터로 사용된 촬영 기기

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 24.수집 2026. 06. 28.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.