왜 중요한가
포장 손상은 얇고 분지형이며 비선형적인 균열로 구성되어 바운딩 박스만으로는 기하학적 특성을 충분히 포착하기 어렵다. 픽셀 수준 세분화는 균열 면적 추정 및 형태 분석에 필요한 정밀 정보를 제공하며, 현장 도로 이미지에서 다중 손상 클래스를 한 번에 로컬라이즈하고 마스크를 통해 면적을 계산할 수 있다. 본 연구는 네 가지 손상 클래스(longitudinal, transverse, alligator, pothole)에 대해 Polygon 라벨로 주석된 UWGB-STREETCRACK 데이터를 사용해 Mask R-CNN 기반의 엔드투엔드 파이프라인의 실용성을 평가한다.
핵심 기여
UWGB-STREETCRACK 데이터셋 구성 및 polygon 수준 주석
필드 수집 기반 도로 이미지에 대해 four-class(distress) polygon 레이블을 제공하고, 학습+검증+테스트 분할을 제시한다(Train+validation: 1643 이미지, 2090 인스턴스; Test: 231 이미지, 261 인스턴스).
Mask R-CNN 기반 포장 손상 인스턴스 세분화 파이프라인
Detectron2에서 polygon 좌표를 binary masks로 변환하고 COCO 프리트레인 체크포인트로 초기화한 뒤 4개 클래스에 대해 supervised fine-tuning을 수행한다.
매칭 규칙 및 프로젝트 특성 평가의 재현성 유지
바운딩 박스 IoU 0.1 이상 및 동일 클래스 매칭 규칙으로 예측 인스턴스를 실제 인스턴스에 매칭하고, 최종 예측 임계값 0.75를 고정한다.
SOTA 대비 탐지 및 면적 추정 비교
ResNet-101 FPN 3x 백본의 정밀도 84.23%, 재현율 90.04%, F1 87.04%를 달성했고, crack-area 추정은 2.164%로 ground-truth 2.170%와 차이가 0.006%포인트에 불과하다.
대상 baselines와 한계 분석
YOLO(CSPDarknet53) 기반 detector와 DeepSegmentor를 비교하여, 엔드투엔드 인스턴스 세분화의 실용성을 확인하고 마스크 수준 AP의 부재 및 주석의 한계를 지적한다.
주석 정책 및 실패 케이스 분석
painted 마킹, 기름 얼룩 등 비크랙 패턴으로 인한 오탐 사례와 맨홀 주변의 애매한 해석을 제시하며 주석 정책의 중요성을 강조한다.
핵심 아이디어 이해하기
출발점: 이미지 분류나 바운딩 박스 탐지는 얇고 분지된 균열의 기하를 회복하기 어렵다. 픽셀 수준의 세분화는 균열의 면적 및 형태를 직접 추출해 유지보수 지표를 산출하는 데 필수다. 방법: Detectron2의 Mask R-CNN으로 풀 해상도 도로 이미지를 처리하고 polygon 주석을 binary mask로 변환한 뒤 RoI별로 마스크를 예측한다. 동작 원리: IoU 기반 매칭과 NMS를 통해 후보를 선별하고, 최종 예측은 0.75 임계값으로 결정한다. 달라지는 점: 네 가지 손상 클래스를 인스턴스 단위로 구분하고, 전체 도로 면적에서의 crack-area 비율을 산출해 ground-truth와 거의 일치하는 2.164%를 얻었다.
방법론
"전체 접근 방식: Field 이미지를 대상으로 polygon 주석을 binary 마스크로 변환하고, COCO 프리트레인 가중치로 초기화한 Mask R-CNN 변형들을 4개 클래스에 대해 학습한다." "데이터 전처리 및 증강: 이미지의 짧은 변을 800px로, 긴 변을 1333px로 정규화하고, 학습 시 수평 뒤집기 0.5의 확률만 적용한다. 컬러 변환이나 기타 증강은 사용하지 않는다." "모델 변형: R50-FPN, R101-C4, R101-DC, R101-FPN, X101-FPN 다섯 백본 변형을 평가하고 COCO 프리트레인 가중치로 초기화한다." "추론 구성 및 평가: 추론 시 동일한 비율 유지로 이미지 크기를 조정하고, RPN의 anchor 크기 및 비율을 설정하며, 바운딩 박스 IoU는 0.1, NMS는 0.65(RPN)/0.5(Detector)로 작동시킨 뒤, 최종 예측 임계값 0.75를 고정한다."
관련 Figure

데이터 수집 하드웨어를 시각화하여 현장 도로 이미지 데이터를 모바일 기기로 수집한다는 점을 확인시키며, 데이터 수집 프로토콜의 실용성을 보강한다.
차량 전면에 고정된 스마트폰 마운트 이미지

주석 워크플로를 시각화하여 Polygon 기반 라벨링이 인스턴스 세분화 학습 데이터 준비에 핵심임을 보여준다.
Label Studio에서 four-class polygon annotations를 보여주는 화면
주요 결과
"주요 벤치마크: Mask R-CNN ResNet-101 FPN 3x가 84.23% precision, 90.04% recall, 87.04% F1를 달성했다. YOLO(CSPDarknet53)은 27.5%/20.7%/23.62%를 달성했다." "크랙 면적 추정: Ground truth 2.170%에 대해 모델 추정 2.164%로 절대 오차 0.006%포인트를 기록했다. DeepSegmentor의 추정은 2.130%이며 crop-level로 한정된다." "추가 비교: 본 연구의 엔드투엔드 인스턴스 세분화 파이프라인은 full-scene에서 후보를 로컬라이즈하고 마스크를 예측하므로 실용성이 높은 편이다."
기술 상세
"아키텍처: Mask R-CNN 기반 Detectron2 파이프라인으로 polygon 주석을 binary masks로 로딩하고 4개 클래스에 대해 학습한다." "수학/알고리즘: IoU는 (Bp ∩ Bg) / (Bp ∪ Bg)로 정의되며, 예측 박스와 GT 박스의 IoU가 0.1 이상일 때 매칭으로 간주한다." "차별점: 일반 박스 탐지나 cropped-segmentation과 달리 full-scene에서 인스턴스 단위의 마스크를 예측하고 aggregate crack-area 추정을 제공한다." "학습 상세: 40-에포크 일정, learning rate 0.001, momentum 0.9, weight decay 0.0001, batch size 8, lr는 에포크 24/33에서 0.1로 감소한다."
한계점
"주석의 불확실성과 클래스 간 불균형, 라인-모양의 다중 해석으로 인한 annotation ambiguity" "mask-level AP의 부재와 벤치마크의 제약"
실무 활용
인스턴스 세분화를 활용한 full-scene 포장 손상 분석은 균열 면적 추정에 실용적이다.
- 현장 도로 관리 시스템에 자동 손상 면적 비율 모니터링을 구현
- 도로 유지보수 계획의 우선순위 산정에 활용
- 항공/드론 영상 등의 확대 적용
코드 공개 여부: 미확인
키워드
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.