본문으로 건너뛰기

UAVid에서 CABiNet과 YOLO26-sem 비교

CABiNet-L이 UAVid에서 YOLO26x-sem보다 2.7 mIoU 높고 Forward latency는 약 3배 낮았지만, 모델별 학습 레시피와 데이터셋에 따른 차이는 남았습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 2021년 ICRA에 발표된 효율적 Semantic Segmentation 구조 CABiNet을 다시 구현해 UAVid에서 2026년 계열의 YOLO26-sem과 비교한 재현 가능한 벤치마크입니다. 두 모델은 변환된 데이터와 분할, ENet inverse-log class weighting, EMA 평가 가중치, 단일 스케일 평가를 공유했지만 초기화, 학습 예산, Optimizer, Loss, Augmentation은 각 모델의 native recipe를 유지했습니다. 그 결과 CABiNet-L은 67.14 mIoU와 4.44ms FP16 latency를 기록해 YOLO26x-sem의 64.41 mIoU와 13.09ms보다 높은 정확도와 낮은 순수 Forward latency를 함께 보였고, 비슷한 44 GFLOPs 조건의 CABiNet-S도 YOLO26s-sem보다 3.6 mIoU 높았습니다. 다만 YOLO26n과 YOLO26s는 더 빠른 Pareto Frontier 점이며, VDD와 AeroScapes에서는 YOLO26 계열이 앞서고 단일 학습 실행과 비대칭 Pretraining 때문에 결과를 보편적 우위로 해석할 수는 없습니다.

실용적 조언

  • 서로 다른 계보의 모델을 비교할 때는 데이터 변환과 분할, Class Weighting, 평가 해상도, Test-Time Augmentation 여부를 먼저 동일하게 고정하고 각 모델의 native training recipe는 별도 조건으로 명시하는 방식이 유용합니다.
  • Architecture 차이를 더 엄밀하게 분리하려면 Initialization, Epoch Budget, Optimizer와 Schedule, Loss, Augmentation을 하나씩 통일한 추가 실험이 필요합니다. 원문 표만으로는 각 항목의 개별 기여도를 산출할 수 없으므로 한 번의 종합 비교를 단일 원인에 귀속하지 않는 편이 안전합니다.
  • 정확도 차이를 해석할 때는 여러 Seed의 반복 실행과 분산을 함께 기록하고, 순수 모델 Forward latency와 실제 4K 입력의 전처리·타일링·후처리 비용을 분리해 보고하는 편이 좋습니다. 특히 Depthwise Convolution처럼 FLOPs와 GPU latency가 다르게 움직이는 구조는 Target Hardware와 Runtime을 고정한 측정이 필요합니다.

섹션별 상세

01
작성자는 CABiNet의 첫 저자라는 이해관계와 함께 결과가 저장소에서 재현 가능하다는 점을 먼저 밝혔습니다. 2021년 구조를 PyTorch 2.x, Hydra, AMP, EMA, poly-LR, OHEM loss, CI와 테스트를 포함한 형태로 재구축하고, 원 논문이 겨냥한 항공 영상 데이터셋 UAVid에서 최신 일반 다중 작업 모델의 Semantic Segmentation 변형과 비교했습니다. 비교 목적은 특정 모델의 절대적 우위를 선언하는 것이 아니라, 효율성을 목표로 설계된 구조와 다른 계보의 최신 모델을 어떤 조건에서 비교할 수 있는지 확인하는 데 있었습니다.
02
두 모델은 동일하게 변환한 데이터와 분할, ENet inverse-log class weighting의 cls_pw=0.5, EMA 가중치 평가, 단일 스케일과 Test-Time Augmentation 제외 조건을 사용했습니다. 반면 CABiNet은 ImageNet-pretrained MobileNetV3 backbone과 SGD, poly decay, decoder LR ×10, OHEM-CE를 사용했고 YOLO26-sem은 Cityscapes와 ADE20K Pretraining, SGD와 cosine schedule, CE + Dice, mosaic 0.8과 copy-paste 0.15를 사용했습니다. 따라서 데이터 표현과 평가 절차는 통제했지만 초기화와 학습법까지 통일한 Architecture-only Ablation은 아니며, 표의 각 차이가 정확도에 기여한 정도는 따로 측정되지 않았습니다.
03
UAVid test split의 1024×1024 단일 스케일 평가에서 CABiNet-L은 67.14 mIoU, 9.17M Parameters, 54.8 GFLOPs, 4.44ms와 225 FPS를 기록했습니다. CABiNet-S는 65.25 mIoU와 3.09ms를 기록했고, 비슷한 44 GFLOPs의 YOLO26s-sem은 61.69 mIoU와 2.52ms였으므로 정확도 차이는 3.6 mIoU였습니다. YOLO26n과 YOLO26s는 더 낮은 지연 시간의 유효한 Pareto Frontier 점이지만, YOLO26m·l·x는 적어도 하나의 CABiNet 변형보다 느리고 정확도도 낮아 지배된 점으로 분류됐습니다.
04
CABiNet-L과 YOLO26x-sem의 2.7 mIoU 차이는 주로 작은 객체와 가는 객체에서 발생했습니다. Human IoU는 28.3 대 21.1로 CABiNet-L이 7.2포인트 높았고, Static Car는 57.2 대 51.3, Moving Car는 71.9 대 66.8이었으며, Building은 YOLO26x-sem이 87.4로 CABiNet-L의 87.1보다 0.2포인트 높았습니다. 정성 비교의 두 프레임에서는 YOLO26x-sem이 주차장 구조를 Static-Car와 Clutter의 큰 덩어리로 합치고 Building을 주차장으로 번지게 한 반면 CABiNet-L은 Ground Truth에 더 가깝게 경계를 추적했지만, 해당 프레임은 무작위 대표 표본이 아니라 클래스 차이를 보여주도록 선택됐습니다.
05
작성자는 결과가 모든 데이터셋과 속도 조건에서 CABiNet의 승리를 뜻하지 않는다고 제한했습니다. VDD와 AeroScapes의 동일한 평가에서는 YOLO26 s 이상이 CABiNet-L보다 앞섰고, CABiNet은 중간권에 머물렀으며, MobileNetV3의 Depthwise Convolution은 FLOPs가 낮아도 GPU latency가 같은 비율로 낮아지지 않았습니다. 또한 결과는 단일 학습 실행에 기반해 Seed별 분산이나 통계적 유의성을 계산하지 않았고, 약 1포인트 미만의 차이는 과해석하지 말아야 하며, RTX 4070 SUPER에서 측정한 순수 모델 Forward latency는 TensorRT·ONNX·Jetson·4K 전체 프레임 처리 비용을 포함하지 않습니다.
06
초기화 조건도 중요한 교란 요인으로 남았습니다. YOLO26-sem은 Cityscapes와 ADE20K에서 Pretraining한 전체 네트워크로 시작했지만 CABiNet은 ImageNet-pretrained backbone만 사용했으므로, 항공 데이터로 전이할 때 YOLO26 쪽에 도메인 관련 이점이 있을 가능성이 있습니다. 그 크기를 측정하지 않은 상태에서 CABiNet이 더 높은 UAVid 정확도를 얻었다는 점은 관심을 끌지만, 이 비대칭성 때문에 결과를 순수한 Architecture 비교로 단정할 수는 없습니다.
07
작성자는 CABiNet-L과 CABiNet-S, 모든 YOLO26-sem 크기의 Weights, Model Cards와 Metrics, Hydra Configs, 데이터 변환기와 평가 스크립트를 공개했습니다. Hugging Face Demo에서는 사용자가 자신의 항공 이미지를 넣어 UAVid Checkpoint의 결과를 확인할 수 있고, GitHub 저장소에는 코드와 Leaderboard가 함께 제공됩니다. 이 자료를 통해 동일 데이터와 평가 절차를 재실행하거나, 각 모델의 학습 레시피와 Deployment 조건을 추가로 맞춰 후속 비교를 수행할 수 있습니다.

용어 해설

이중 분기 CNN(Dual-branch CNN)
하나의 네트워크를 고해상도 공간 정보 분기와 문맥 정보 분기로 나누어 처리한 뒤 Feature Fusion Module에서 결합하는 구조입니다. 세밀한 객체 위치와 넓은 영역의 의미 정보를 함께 유지해 Semantic Segmentation에 활용됩니다.
Semantic Segmentation
입력 이미지의 모든 픽셀에 건물, 도로, 차량 같은 클래스를 할당하는 작업입니다. 이미지 전체를 하나의 라벨로 분류하는 방식과 달리 픽셀 단위 경계를 얻기 때문에 자율주행과 항공 영상 분석에 쓰입니다.
Pareto Frontier
정확도와 지연 시간처럼 서로 상충하는 지표에서 어느 한 모델이 다른 모델보다 모든 면에서 뒤처지지 않는 최적 점들의 경계입니다. 이 글에서는 더 빠르면서 정확도도 높은 모델이 기존 점을 지배하는지 판단하는 기준으로 사용됩니다.
OHEM Loss
Online Hard Example Mining을 적용한 손실 함수로, 학습 중 분류가 어려운 픽셀이나 샘플에 더 집중합니다. CABiNet은 OHEM-CE와 보조 Deep Supervision을 사용해 Semantic Segmentation 학습을 구성했습니다.
EMA Weights
학습 중 모델 가중치의 지수 이동 평균을 유지하고 평가 시 평균 가중치를 사용하는 방식입니다. 개별 업데이트의 변동을 완화한 가중치로 두 모델을 평가해 학습 후 검증 조건을 맞추는 데 사용됐습니다.
Depthwise Convolution
채널별로 공간 필터를 따로 적용한 뒤 필요한 채널 결합을 수행하는 합성곱입니다. 일반 합성곱보다 FLOPs를 크게 줄일 수 있지만 GPU의 실제 메모리 접근과 커널 실행 특성 때문에 FLOPs 감소가 같은 폭의 지연 시간 감소로 이어지지는 않습니다.

언급된 도구

PyTorch 2.x중립

CABiNet 저장소를 최신 PyTorch 환경으로 재구축하고 학습 및 평가를 실행하는 기반 프레임워크

Hydra중립

학습, 데이터 변환, 평가 설정을 구성 파일로 관리하는 도구

thop중립

CABiNet의 1024² Forward Pass FLOPs를 계산하는 프로파일러

Ultralytics profiler중립

YOLO26의 분석적 Forward-Pass FLOPs를 계산하는 프로파일러

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 03.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.