TL;DR
이 글은 2021년 ICRA에 발표된 효율적 Semantic Segmentation 구조 CABiNet을 다시 구현해 UAVid에서 2026년 계열의 YOLO26-sem과 비교한 재현 가능한 벤치마크입니다. 두 모델은 변환된 데이터와 분할, ENet inverse-log class weighting, EMA 평가 가중치, 단일 스케일 평가를 공유했지만 초기화, 학습 예산, Optimizer, Loss, Augmentation은 각 모델의 native recipe를 유지했습니다. 그 결과 CABiNet-L은 67.14 mIoU와 4.44ms FP16 latency를 기록해 YOLO26x-sem의 64.41 mIoU와 13.09ms보다 높은 정확도와 낮은 순수 Forward latency를 함께 보였고, 비슷한 44 GFLOPs 조건의 CABiNet-S도 YOLO26s-sem보다 3.6 mIoU 높았습니다. 다만 YOLO26n과 YOLO26s는 더 빠른 Pareto Frontier 점이며, VDD와 AeroScapes에서는 YOLO26 계열이 앞서고 단일 학습 실행과 비대칭 Pretraining 때문에 결과를 보편적 우위로 해석할 수는 없습니다.
실용적 조언
- 서로 다른 계보의 모델을 비교할 때는 데이터 변환과 분할, Class Weighting, 평가 해상도, Test-Time Augmentation 여부를 먼저 동일하게 고정하고 각 모델의 native training recipe는 별도 조건으로 명시하는 방식이 유용합니다.
- Architecture 차이를 더 엄밀하게 분리하려면 Initialization, Epoch Budget, Optimizer와 Schedule, Loss, Augmentation을 하나씩 통일한 추가 실험이 필요합니다. 원문 표만으로는 각 항목의 개별 기여도를 산출할 수 없으므로 한 번의 종합 비교를 단일 원인에 귀속하지 않는 편이 안전합니다.
- 정확도 차이를 해석할 때는 여러 Seed의 반복 실행과 분산을 함께 기록하고, 순수 모델 Forward latency와 실제 4K 입력의 전처리·타일링·후처리 비용을 분리해 보고하는 편이 좋습니다. 특히 Depthwise Convolution처럼 FLOPs와 GPU latency가 다르게 움직이는 구조는 Target Hardware와 Runtime을 고정한 측정이 필요합니다.
섹션별 상세
용어 해설
- 이중 분기 CNN(Dual-branch CNN)
- — 하나의 네트워크를 고해상도 공간 정보 분기와 문맥 정보 분기로 나누어 처리한 뒤 Feature Fusion Module에서 결합하는 구조입니다. 세밀한 객체 위치와 넓은 영역의 의미 정보를 함께 유지해 Semantic Segmentation에 활용됩니다.
- Semantic Segmentation
- — 입력 이미지의 모든 픽셀에 건물, 도로, 차량 같은 클래스를 할당하는 작업입니다. 이미지 전체를 하나의 라벨로 분류하는 방식과 달리 픽셀 단위 경계를 얻기 때문에 자율주행과 항공 영상 분석에 쓰입니다.
- Pareto Frontier
- — 정확도와 지연 시간처럼 서로 상충하는 지표에서 어느 한 모델이 다른 모델보다 모든 면에서 뒤처지지 않는 최적 점들의 경계입니다. 이 글에서는 더 빠르면서 정확도도 높은 모델이 기존 점을 지배하는지 판단하는 기준으로 사용됩니다.
- OHEM Loss
- — Online Hard Example Mining을 적용한 손실 함수로, 학습 중 분류가 어려운 픽셀이나 샘플에 더 집중합니다. CABiNet은 OHEM-CE와 보조 Deep Supervision을 사용해 Semantic Segmentation 학습을 구성했습니다.
- EMA Weights
- — 학습 중 모델 가중치의 지수 이동 평균을 유지하고 평가 시 평균 가중치를 사용하는 방식입니다. 개별 업데이트의 변동을 완화한 가중치로 두 모델을 평가해 학습 후 검증 조건을 맞추는 데 사용됐습니다.
- Depthwise Convolution
- — 채널별로 공간 필터를 따로 적용한 뒤 필요한 채널 결합을 수행하는 합성곱입니다. 일반 합성곱보다 FLOPs를 크게 줄일 수 있지만 GPU의 실제 메모리 접근과 커널 실행 특성 때문에 FLOPs 감소가 같은 폭의 지연 시간 감소로 이어지지는 않습니다.
언급된 도구
CABiNet 저장소를 최신 PyTorch 환경으로 재구축하고 학습 및 평가를 실행하는 기반 프레임워크
학습, 데이터 변환, 평가 설정을 구성 파일로 관리하는 도구
CABiNet의 1024² Forward Pass FLOPs를 계산하는 프로파일러
YOLO26의 분석적 Forward-Pass FLOPs를 계산하는 프로파일러
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.