TL;DR
YOLO26-depth의 CSPDarknet backbone과 PAN-FPN neck을 그대로 가져오고, 깊이 예측 head만 RGBHead라는 복원 decoder로 교체해 deraining 모델을 만들었습니다. RGBHead는 다중 스케일 특징을 융합한 뒤 stride-2와 stride-4 skip connection으로 세부 정보를 보충하고, 입력에 더할 잔차를 원본 해상도까지 복원합니다. 동일한 구조와 ClearView 학습 레시피를 100 epoch씩 적용한 비교에서 depth 초기화는 무작위 초기화보다 평균 PSNR 27.45에서 27.94로, SSIM 0.807에서 0.813으로 높았으며 10개 테스트 세트 모두에서 승리했습니다. 다만 이 결과는 depth pretraining이 classification pretraining보다 우수하거나 depth가 왜 도움이 되는지까지 입증하지 않으며, yolo26_rgb_s는 12.13M 파라미터와 30.95 dB, 92.2 qps로 실시간 운용 지점을 확보했지만 NAFNet-Small보다 PSNR이 낮고 약 4배 느립니다.
섹션별 상세


용어 해설
- 밀집 회귀(Dense Regression)
- — 이미지의 각 픽셀 위치마다 연속적인 값을 예측하는 방식입니다. 이 프로젝트에서는 깊이 맵이나 빗물 제거 결과처럼 입력과 같은 해상도의 출력을 만들기 위해 특징을 여러 해상도에서 결합한 뒤 픽셀별 보정값을 계산합니다.
- PSNR
- — 복원된 이미지와 정답 이미지의 픽셀 차이를 로그 척도로 측정하는 품질 지표입니다. 값이 높을수록 두 이미지의 수치적 오차가 작다는 뜻이며, 이 실험에서는 9개 비 테스트 세트 평균과 10개 테스트 세트 평균에 사용됐습니다.
- SSIM
- — 이미지의 밝기와 대비, 구조가 정답과 얼마나 유사한지 측정하는 지표입니다. YOLO26-depth 초기화는 무작위 초기화보다 평균 SSIM을 0.807에서 0.813으로 높였고, 10개 테스트 세트 모두에서 우세했습니다.
- 잔차 학습(Residual Learning)
- — 모델이 완성된 이미지를 직접 생성하지 않고 입력 이미지에 더할 보정값을 예측하는 학습 방식입니다. RGBHead는 빗물 입력에 잔차를 더해 깨끗한 이미지를 출력하므로 원본 구조를 보존하면서 제거할 부분을 학습합니다.
- 스킵 연결(Skip Connection)
- — 초기 저해상도 특징을 후단 복원부로 직접 전달하는 연결입니다. 이 구조는 8배 다운샘플링 병목을 거치지 않고 stride-2와 stride-4 단계의 세부 정보를 reconstruction tail에 공급해 픽셀 단위 복원을 돕습니다.
- TensorRT FP16 추론(TensorRT FP16)
- — TensorRT에서 16비트 부동소수점 연산으로 모델을 실행하는 배포 방식입니다. 이 프로젝트는 RTX 4070 SUPER에서 1920×1080 입력과 배치 1 조건으로 처리량을 측정했으며, YOLO26 RGB 모델의 실시간 처리 지점을 비교했습니다.
언급된 도구
합성 비와 실제 비를 섞은 학습 레시피, Charbonnier loss, 10개 테스트 세트 평가 프로토콜을 제공했습니다.
RTX 4070 SUPER에서 FP16 모델을 1920×1080 입력과 배치 1 조건으로 배포하고 처리량을 측정했습니다.
deraining PSNR 비교표의 기준 모델로 사용됐으며, 12GB GPU의 1080p TensorRT 빌드에서는 attention 경로 융합에 약 14.4GB scratch가 필요했습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.