본문으로 건너뛰기

YOLO26-depth 가중치, 빗물 제거로 전이

YOLO26-depth로 학습한 backbone과 neck이 무작위 초기화보다 deraining에서 평균 PSNR 0.48 dB 높은 출발점을 만들었습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

YOLO26-depth의 CSPDarknet backbone과 PAN-FPN neck을 그대로 가져오고, 깊이 예측 head만 RGBHead라는 복원 decoder로 교체해 deraining 모델을 만들었습니다. RGBHead는 다중 스케일 특징을 융합한 뒤 stride-2와 stride-4 skip connection으로 세부 정보를 보충하고, 입력에 더할 잔차를 원본 해상도까지 복원합니다. 동일한 구조와 ClearView 학습 레시피를 100 epoch씩 적용한 비교에서 depth 초기화는 무작위 초기화보다 평균 PSNR 27.45에서 27.94로, SSIM 0.807에서 0.813으로 높았으며 10개 테스트 세트 모두에서 승리했습니다. 다만 이 결과는 depth pretraining이 classification pretraining보다 우수하거나 depth가 왜 도움이 되는지까지 입증하지 않으며, yolo26_rgb_s는 12.13M 파라미터와 30.95 dB, 92.2 qps로 실시간 운용 지점을 확보했지만 NAFNet-Small보다 PSNR이 낮고 약 4배 느립니다.

섹션별 상세

01
YOLO26-depth에서 CSPDarknet backbone과 PAN-FPN neck을 변경하지 않고 가져온 뒤, 1채널 Depth head를 새로운 RGBHead로 교체했습니다. RGBHead는 P3·P4·P5 특징을 공통 폭으로 투영하고 P5에서 P3 방향으로 업샘플링과 덧셈을 반복한 뒤, 입력 해상도까지 복원하는 tail에서 3채널 잔차를 출력합니다. 깊이 decoder의 다중 스케일 융합은 재사용하지만 전체 해상도 복원과 세부 정보 보존은 새로운 tail과 skip connection으로 보완해 deraining의 픽셀 단위 출력에 맞췄습니다.
YOLO26 backbone과 PAN-FPN neck 뒤에 RGBHead의 fusion·tail을 연결하고 skip connection과 global residual로 입력 해상도의 RGB 출력을 만드는 구조도입니다.
Diagram도식은 입력이 변경되지 않은 backbone과 neck을 통과한 뒤 RGBHead의 fusion에서 P5·P4·P3 특징을 순차적으로 결합하는 흐름을 보여줍니다. stride-2와 stride-4 특징은 tail로 직접 전달되고, tail이 예측한 잔차는 padded input에 더해 최종 출력을 만듭니다. 본문에서 설명한 다중 스케일 융합, 세부 정보 보존, residual output의 구현 관계를 한눈에 확인할 수 있습니다.
02
ClearView의 합성·실제 비 혼합 학습 레시피와 Charbonnier loss, 10개 테스트 세트 프로토콜을 사용해 depth 초기화와 무작위 초기화를 통제 비교했습니다. 두 조건은 같은 구조와 학습 방법으로 100 epoch씩 실행됐고, YOLO26-depth checkpoint를 불러올 때 backbone과 neck의 468개 tensor가 모두 일치했으며 새 RGBHead만 무작위로 시작했습니다. 평균 PSNR은 27.452에서 27.935로 0.48 dB 높아졌고 평균 SSIM은 0.807에서 0.813으로 상승했으며, depth 초기화가 10개 세트 전부에서 무작위 초기화를 앞섰습니다.
03
초기화 차이는 학습 후반에만 생긴 결과가 아니라 20 epoch 시점에 이미 약 0.49 dB로 나타났습니다. 1 epoch 확인에서는 통계적으로 뚜렷한 차이가 없었지만 100 epoch까지 격차가 거의 줄지 않아, 단순히 무작위 모델이 더 오래 학습하면 따라잡는 현상으로 보기는 어렵습니다. 다만 이 실험은 depth supervision이 복원에 유용한 공간 구조를 학습했는지, 아니면 YOLO26-depth checkpoint 자체가 강한 사전학습 표현인지 구분하지 못하므로 원인까지 확정하지는 않습니다.
04
ClearView의 9개 비 테스트 세트 순위에서 yolo26_rgb_s는 12.13M 파라미터와 평균 30.95 dB를, yolo26_rgb_n은 5.25M 파라미터와 30.83 dB를 기록했습니다. TensorRT FP16과 RTX 4070 SUPER, 1920×1080, 배치 1 조건에서 두 모델은 각각 92.2 qps와 108.6 qps를 기록해 ResNet34-UNet의 94.9 qps와 ResNet18-UNet의 110.3 qps에 가까운 속도를 유지하면서 더 적은 파라미터와 높은 PSNR을 보였습니다. 그러나 NAFNet-Small은 1.1M 파라미터로 31.15 dB를 내면서도 26.9 qps로 약 4배 느리므로 모든 효율 축에서 우세한 모델은 아닙니다.
05
모델의 약점은 가까이서 보면 희미한 빗줄기가 남고, 조밀한 비가 평평하고 질감이 적은 배경을 덮을 때 성능이 가장 나쁘다는 점입니다. 비와 안개가 함께 있는 AllWeather에서는 YOLO26 RGB 모델과 ClearView 기준 모델이 모두 약 13.5 dB에 머물러 순위에서 제외됐습니다. 따라서 결과의 적용 범위는 하나의 deraining 작업과 nano·small 두 가지 규모에 한정되며, 일반적인 image restoration 모델로 확대 해석할 근거는 부족합니다.
빗줄기가 있는 공원 입력 이미지와 yolo26_rgb_s가 처리한 출력 이미지를 나란히 비교한 시각적 예시입니다.
Screenshot입력 쪽에는 나무와 산책로 위에 수직 빗줄기가 넓게 겹쳐 있지만, 출력 쪽에서는 대부분의 빗줄기가 줄어들어 배경과 산책로가 더 선명하게 보입니다. 동시에 본문이 밝힌 한계처럼 세부 영역에 잔여 흔적이 남을 가능성을 정량 지표만으로는 확인하기 어렵습니다. 이 이미지는 모델의 deraining 결과를 직관적으로 보완하지만 PSNR이나 SSIM 수치를 직접 제공하지는 않습니다.

용어 해설

밀집 회귀(Dense Regression)
이미지의 각 픽셀 위치마다 연속적인 값을 예측하는 방식입니다. 이 프로젝트에서는 깊이 맵이나 빗물 제거 결과처럼 입력과 같은 해상도의 출력을 만들기 위해 특징을 여러 해상도에서 결합한 뒤 픽셀별 보정값을 계산합니다.
PSNR
복원된 이미지와 정답 이미지의 픽셀 차이를 로그 척도로 측정하는 품질 지표입니다. 값이 높을수록 두 이미지의 수치적 오차가 작다는 뜻이며, 이 실험에서는 9개 비 테스트 세트 평균과 10개 테스트 세트 평균에 사용됐습니다.
SSIM
이미지의 밝기와 대비, 구조가 정답과 얼마나 유사한지 측정하는 지표입니다. YOLO26-depth 초기화는 무작위 초기화보다 평균 SSIM을 0.807에서 0.813으로 높였고, 10개 테스트 세트 모두에서 우세했습니다.
잔차 학습(Residual Learning)
모델이 완성된 이미지를 직접 생성하지 않고 입력 이미지에 더할 보정값을 예측하는 학습 방식입니다. RGBHead는 빗물 입력에 잔차를 더해 깨끗한 이미지를 출력하므로 원본 구조를 보존하면서 제거할 부분을 학습합니다.
스킵 연결(Skip Connection)
초기 저해상도 특징을 후단 복원부로 직접 전달하는 연결입니다. 이 구조는 8배 다운샘플링 병목을 거치지 않고 stride-2와 stride-4 단계의 세부 정보를 reconstruction tail에 공급해 픽셀 단위 복원을 돕습니다.
TensorRT FP16 추론(TensorRT FP16)
TensorRT에서 16비트 부동소수점 연산으로 모델을 실행하는 배포 방식입니다. 이 프로젝트는 RTX 4070 SUPER에서 1920×1080 입력과 배치 1 조건으로 처리량을 측정했으며, YOLO26 RGB 모델의 실시간 처리 지점을 비교했습니다.

언급된 도구

ClearView중립링크

합성 비와 실제 비를 섞은 학습 레시피, Charbonnier loss, 10개 테스트 세트 평가 프로토콜을 제공했습니다.

TensorRT중립

RTX 4070 SUPER에서 FP16 모델을 1920×1080 입력과 배치 1 조건으로 배포하고 처리량을 측정했습니다.

Restormer중립

deraining PSNR 비교표의 기준 모델로 사용됐으며, 12GB GPU의 1080p TensorRT 빌드에서는 attention 경로 융합에 약 14.4GB scratch가 필요했습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.