TL;DR
실제 사진에서 발생하는 공간적으로 비균일한 모션 블러는 단일 커널 가정이나 지역적 연산만으로는 복구가 어렵다. CogSENet은 고수준 의미 정보와 물리적 블러 추정을 결합해 어떤 영역을 어떻게 복원할지 선택적으로 조정함으로써 복잡한 비균일 블러에 강건한 복원을 가능하게 했다. 이 접근은 단일 작업 프레임워크로 deblurring뿐 아니라 deraining, dehazing, denoising 같은 다른 저수준 비전 문제에도 적용 가능함이 논문에서 확인됐다.
왜 중요한가
실제 사진에서 발생하는 공간적으로 비균일한 모션 블러는 단일 커널 가정이나 지역적 연산만으로는 복구가 어렵다. CogSENet은 고수준 의미 정보와 물리적 블러 추정을 결합해 어떤 영역을 어떻게 복원할지 선택적으로 조정함으로써 복잡한 비균일 블러에 강건한 복원을 가능하게 했다. 이 접근은 단일 작업 프레임워크로 deblurring뿐 아니라 deraining, dehazing, denoising 같은 다른 저수준 비전 문제에도 적용 가능함이 논문에서 확인됐다.
핵심 기여
Semantic-Driven State-Space Module (SDSSM)의 도입
SDSSM은 Gumbel-Softmax 기반의 시맨틱 라우팅으로 토큰을 의미 그룹으로 재배열하고, 재배열된 시퀀스에 대해 선택적(선택적 스캔) 1D state-space 스캔을 수행해 비인과적 장거리 의존성을 포착한다. 이 과정에서 각 토큰에 대한 연속 프롬프트를 학습해 상태 행렬의 방출 행렬 C에 조건을 주입함으로써 문맥-의존적 동적 전파를 구현한다. SDSSM은 self-attention의 N^2 비용을 피하면서 의미적으로 관련된 먼 영역 간 상호작용을 허용해 블러 확산과 아티팩트 전파를 억제했다.
Bi-Frequency Fusion Block (BFFB)를 통한 명시적 주파수 분리
BFFB는 웨이브렛 변환으로 특징을 저주파(LL)와 고주파(H)로 분해한 뒤 저주파는 U-shaped 구조로 구조적 정보를, 고주파는 밀집 합성곱으로 텍스처를 전문적으로 처리한다. 병렬로 Fourier-domain 기반의 주파수 정련 경로를 두어 학습 가능한 스펙트럴 필터 M으로 주파수 응답을 재가중한 뒤 역변환해 아티팩트 억제와 텍스처 회복을 수행한다. 두 경로는 동적 가중치 β로 적응적으로 융합되어 전역 구조와 미세 디테일을 균형 있게 보존한다.
Continuous Blur Field와 CLIP 프리어즈의 결합을 통한 포컬 어댑테이션
경량 CNN으로 입력에서 연속적인 2D 변위 필드 u를 예측하고 tanh·d_max로 제약해 병목 특징과 결합한다. 병목 특징과 CLIP 이미지 임베딩 간의 코사인 유사도를 통해 픽셀 단위의 공간 attention map을 계산하고 learnable scalar γ로 잔차 게이팅해 의미-물리 결합 조절을 수행한다. 이 모듈은 심한 블러가 존재하는 의미적 영역으로 네트워크의 복원 자원을 동적으로 집중시켜 과대 증폭이나 불필요한 잡음 복원을 방지한다.
경량성 유지와 범용성 검증
경량 설정(Ours)은 8.9M 파라미터로 GoPro에서 34.72 dB PSNR과 0.9744 SSIM을 달성했고, 확장 구성(Ours+)는 표현력을 높여 추가 성능 개선을 보였다. 네트워크는 한 가지 학습 파이프라인으로 deblurring 외에 deraining, dehazing, denoising에서도 경쟁력 있는 결과를 기록해 실무 적용 가능성을 보였다. 아키텍처는 U-shaped 멀티스케일 백본에 CogSF 블록을 쌓아 encoder–decoder 방식으로 코스-투-파인 복원을 수행하도록 설계되었다.
핵심 아이디어 이해하기
많은 기존 복원 모델은 입력 특징을 균질하게 처리해 의미적 경계와 물리적 블러를 구분하지 못했다. 이미지의 고주파 텍스처와 저주파 구조는 다른 복원 전략을 요구하고, 의미적 정보는 어느 영역에 복원 노력을 집중할지 결정하는 핵심 신호가 된다. 따라서 의미 인지와 주파수 분해를 결합하면 어떤 것을 복원할지와 어떻게 복원할지 두 축에서 동시 최적화가 가능하다. SDSSM은 토큰별 시맨틱 할당을 Gumbel-Softmax로 연속적으로 근사해 역전파가 가능하도록 하고, 지배적 클러스터 인덱스에 따라 토큰을 재배열해 semantically-contiguous한 시퀀스를 만든 뒤 1D state-space 스캔을 수행한다. 이 스캔은 각 스텝에서 상태 h를 갱신하고 출력 y를 생성하는데, 토큰-기반 프롬프트 z를 방출 행렬 C에 더해 동적 컨텍스트 의존성을 주입한다. 그 결과 의미적으로 관련된 먼 영역들이 선택적으로 상호작용하며, 불필요한 정보 확산이 억제된 선형 복잡성의 장거리 모델링이 실현된다. BFFB는 웨이브렛으로 특징을 LL/H로 분해해 저주파는 전역 구조 복원에, 고주파는 세부 텍스처 회복에 각각 특화된 경로로 처리한다. 병렬 Fourier-domain refinement는 학습 가능한 스펙트럼 필터 M으로 주파수 응답을 조절해 아티팩트를 억제하고 텍스처를 보강한다. 두 경로는 학습 가능한 가중치 β로 적응적으로 융합되어 물리적으로 해석 가능한 복원 결과를 만든다.
관련 Figure

이미지는 CogSENet 설계가 독수리의 능동적 주시, 망막의 주파수 분화, 초점 적응, 기억 기반 재호출 네 가지 생체 메커니즘과 직접적으로 상응함을 시각적으로 연결한다. 이 도식은 SDSSM이 의미 기반 스캔을, BFFB가 주파수 분리를, CBF와 CLIP이 물리·인지적 조정을 각각 담당함을 빠르게 파악하게 해 모델 구성의 직관적 근거를 제공한다. 방법론 섹션에서 제시된 각 모듈의 목적과 연결되어 논문 전체 설계 의도를 보강한다.
논문의 생체 영감 도식으로 독수리의 시각 메커니즘과 대응하는 SDSSM·BFFB·CBF·CLIP의 역할을 도식화했다.
방법론
CogSENet은 U-shaped 멀티스케일 encoder–decoder 백본에 CogSF 블록을 층층이 배치한 구조로 구성된다. 입력은 3×3 오버랩 컨볼루션으로 얕은 특징을 추출한 뒤 세 단계의 계층에서 공간 해상도를 절반씩 줄이며 채널을 두 배로 늘리는 방식으로 인코딩되고, 디코더는 대칭적으로 복원해 skip connection으로 세부를 통합한다. 병목 단계에서 경량 CNN으로 연속 Blur Field(CBF)를 예측하고 이를 병목 특징과 결합한 후, frozen CLIP 임베딩과 코사인 유사도로 공간 attention을 계산해 잔차 게이팅 방식으로 병목 특징을 조절한다. 각 CogSF 블록은 먼저 SDSSM으로 의미 기반 토큰 재배열과 선택적 state-space 스캔을 수행해 글로벌 컨텍스트를 집계하고, 이어서 BFFB로 저주파와 고주파를 명시적으로 분리해 주파수별로 정제한다. SDSSM 내부에서 토큰 t를 K개 클러스터로 할당하는 확률 p_i는 Gumbel-Softmax로 근사되며, 학습 가능한 코드북 E로부터 프롬프트 z_i를 기대값으로 계산해 상태-방출 행렬에 조건을 부여한다. 재배열된 시퀀스는 행렬 Ā_j, B̄_j로 상태를 갱신하고 C_j+z̃_j로 출력을 생성한 뒤 역순 재배치와 그리드 폴딩으로 원래 공간에 다시 합산된다. BFFB는 웨이브렛 프로젝션 W로 X를 X_LL과 X_H로 분해하고 Φ_low는 저주파 구조에 대해 경량 U-shaped 모듈을, Φ_high는 고주파 세부에 대해 밀집 합성곱을 적용한다. 병렬로 ℱ(·)를 통해 주파수 영역으로 맵핑한 뒤 학습 가능한 스펙트럴 필터 M으로 재가중해 ℱ^{-1}로 되돌리는 경로를 둔다. 최종 출력은 X + β·W^{-1}(Φ_low(X_LL), Φ_high(X_H)) + (1-β)·ℱ^{-1}(M ⊙ ℱ(X)) 형태의 적응적 잔차 융합으로 얻어진다. 학습은 세 단계의 progressive training으로 이루어지며 초기 패치 크기 128×128, 300k iterations의 스테이지1을 시작으로 256×256와 320×320 패치로 확장한다. 최적화는 AdamW를 사용하고 cosine annealing 스케줄과 다단계 배치 및 학습률 감소를 적용했으며, 실험은 NVIDIA L40 4 GPU에서 수행되었다.
관련 Figure

이 그림은 U-shaped 멀티스케일 백본 아래에 CogSF 블록이 어떻게 배치되고 다운/업샘플링 경로와 병목에서의 Blur Field 추정 및 CLIP 결합이 어떻게 이뤄지는지를 상세히 나타낸다. 모듈 간 데이터 흐름과 병목에서의 attention 계산, BFFB 내부 HPB 구성 등 구현 관점의 핵심 구조를 한눈에 제공해 기술적 재현과 이해에 실질적 도움을 준다. 따라서 방법론과 technical_details를 보강하는 핵심 Figure이다.
CogSENet의 전체 아키텍처 다이어그램으로 CogSF 블록, SDSSM, BFFB, 병목의 CBF·CLIP 모듈 배치를 보여준다.

이 도식은 Gumbel-Softmax로 얻은 p_i를 통해 프롬프트 z_i를 생성하고 정렬된 토큰 시퀀스에 대해 state-space 스캔을 적용하는 연산 흐름을 단계적으로 보여준다. 정렬 인덱스는 detach 처리해 그라디언트가 프롬프트를 통해 흐르도록 설계된 점과 Ā,B̄,C_j 수식이 실제 구현상 어떻게 반영되는지 이해를 돕는다. SDSSM의 알고리즘적 핵심을 나타내므로 methodology 및 technical_details와 가장 직접적으로 연결된다.
SDSSM의 내부 동작과 토큰 라우팅, 프롬프트 생성 및 선택적 스캔 과정을 시퀀스 관점에서 도식화했다.
주요 결과
메인 벤치마크에서 경량 구성(Ours, 8.9M 파라미터)은 GoPro에서 34.72 dB PSNR·0.9744 SSIM을 달성했고, 확장 구성(Ours+, 19.4M)은 추가 성능 향상을 보였다. 비교 표(Table 1)는 동일한 벤치마크 상의 다수 최신 기법과의 정량적 비교를 제시하며, Ours는 적은 파라미터로도 FFTformer·EVSSM 등 경쟁 모델 대비 우수한 PSNR을 기록했다. RealBlur-R과 RealBlur-J에서도 Ours는 41.83/0.9799 및 34.54/0.9473의 성능을 보여 실제 촬영 기반 데이터에 대해서도 강건성을 증명했다. Ablation study에서 SDSSM, BFFB, CBF·CLIP 모듈의 기여가 정량적으로 확인됐다. SDSSM을 제거하면 PSNR이 하락하고 파라미터·지연은 증가하는 반면 의미 기반 재배열과 프롬프트 주입은 품질 향상에 핵심적이었다. BFFB의 저/고주파 분리와 암시적 주파수 정제 경로 중 어느 하나라도 제거하면 복원 품질이 유의미하게 떨어졌고, CBF 또는 CLIP만 단독 적용 시보다 두 요소를 결합했을 때 성능 향상이 가장 크게 나타났다. 추가로 CogSENet은 deblurring 외의 교차 태스크에서도 경쟁력을 보였다. Rain100H, BSD68, RESIDE-SOTS 같은 deraining·denoising·dehazing 벤치마크에서 상위권 성능을 보였고, 특히 고잡음·고강도 강수 환경에서 BFFB의 주파수 분리가 복원 안정성에 기여했다. 정성적 비교 그림에서는 미세 텍스처, 문자 및 경계 영역에서 기존 방법 대비 잔류 블러와 과매끄러짐이 적은 결과가 관찰되었다.
관련 Figure

원문 그림은 잎·문자·건물 외벽 등의 고주파 디테일에서 제안 기법이 경쟁 기법보다 에지 보존과 텍스처 회복에서 우수함을 시각적으로 입증한다. 비교군으로 NAFNet, Restormer, EVSSM 등 여러 현대적 방법을 포함해 제안 방법의 상대적 강점을 확인할 수 있으며, 정량적 표의 개선과 정성적 관찰이 일관됨을 보강한다. 이 Figure는 results 블록의 정성적 근거로 직접 연결된다.
GoPro 데이터셋에서 제안 기법과 여러 비교 기법의 정성적 복원 결과를 모아 보여 각 방법의 디테일 회복 차이를 비교했다.

RealBlur는 실제 촬영 기반의 비균일 블러를 포함하므로 이 Figure는 제안 기법의 실제 환경 적용 가능성을 보여준다. 특히 문자와 미세 구조에서 제안 방법이 과도한 평활화 없이 경계를 보존함을 시각적으로 확인할 수 있어 CBF·CLIP 결합의 효과를 직접적으로 뒷받침한다. 결과 섹션에서 보고된 PSNR/SSIM 수치와 시각적 질감 유지가 일치함을 보강한다.
RealBlur 데이터셋의 실제 촬영 이미지에 대한 복원 비교를 제시해 문자와 경계 보존의 우수성을 강조했다.
기술 상세
전체 아키텍처는 세 레벨의 U-shaped encoder–decoder로 구성되며 각 레벨에서 CogSF 블록을 여러 개 쌓아 다중 스케일 특징을 처리한다. 입력은 3×3 오버랩 컨볼루션으로 초기 특징을 얻고, 레벨별로 다운샘플링은 bilinear resize 뒤 3×3 convolution을 적용해 해상도를 절반으로 줄이며 채널을 두 배로 늘린다. 병목에서 경량 CNN으로 예측한 2채널 연속 Blur Field u를 병목 해상도로 리사이즈해 convolution embedding으로 인코딩한 뒤 병목 특징과 concat하고 1×1 fusion으로 blur-aware descriptors를 생성한다. SDSSM은 토큰화된 특징 T∈ℝ^{L×C}에 대해 Gumbel-Softmax로 K개의 클러스터 확률 p_{i,k}를 계산하고 학습 가능한 코드북 E로부터 프롬프트 z_i를 기대값으로 얻는다. 토큰들은 dominant cluster index k_i^*를 기준으로 정렬(정책으로 인덱스는 detach)되어 semantically contiguous한 시퀀스를 만들고, 이 시퀀스에 대해 1D state-space 스캔을 적용한다. 스캔 단계는 h_j = Ā_j h_{j-1} + B̄_j t̃_j, ỹ_j = (C_j + z̃_j) h_j + D t̃_j 형태로, 여기서 z̃_j가 방출 행렬 C에 조건을 주어 문맥 의존적 동적 전파를 실현한다. BFFB는 orthogonal wavelet W로 X를 X_LL(저주파)와 X_H(고주파)로 분해하고 Φ_low는 저주파용 경량 U-shaped 모듈, Φ_high는 고주파용 dense conv 모듈을 적용해 물리적 주파수 분리를 수행한다. 병렬 경로로 Fourier transform ℱ(·)을 통해 스펙트럴 필터 M을 곱하고 ℱ^{-1}로 역투영해 주파수 영역에서 아티팩트 억제를 수행한다. 최종 fusion은 X_out = X + β·W^{-1}(Φ_low(X_LL), Φ_high(X_H)) + (1-β)·ℱ^{-1}(M ⊙ ℱ(X))로 표현되며 β는 콘텐츠 적응형 학습 변수이다. CBF는 CNN_{blur}(I_in)으로부터 얻은 값을 tanh로 바운딩하고 d_max로 스케일링해 u = d_max·tanh(CNN_{blur}(I_in)) 형태로 계산된다. 병목 특징과 CLIP 임베딩 c를 동일 차원으로 맵핑한 뒤 ℓ2 정규화를 수행하고 픽셀 단위 코사인 유사도로 attention map A^{(b)}{i,j}를 계산한다. 병목 특징은 F'{i,j} = F_{i,j} + γ·(A_{i,j} · F_{i,j})로 잔차 게이팅되어 초기 학습 단계에서는 γ를 0으로 초기화해 정체도(identity) 유지와 안정적 수렴을 확보한다. 학습 설정은 shallow channel 48, 백본 블록 수 [6,6,12], 세 단계 progressive training(128→256→320 패치)이며 AdamW 최적화와 cosine annealing을 사용했다. 실험은 4개의 NVIDIA L40 GPU에서 수행되었고 표에 제시된 파라미터·PSNR·SSIM 수치는 논문에 명시된 원문 수치를 그대로 인용했다.
관련 Figure

그림은 입력 블러 이미지, CLIP으로 유도된 주의도, 예측된 연속 블러 필드, 블러 크기 맵을 병렬로 제시해 CBF가 블러 강도에 맞춰 구조적으로 정렬됨을 시각적으로 확인시킨다. CLIP attention은 의미적으로 유의미한 구조를 강조하고 CBF는 그 위에 물리적 블러 정보를 제공해 병목에서의 잔차 게이팅이 어떻게 작동하는지 직관적으로 연결된다. 이 Figure는 continuous blur field와 semantic modulation의 실효성을 뒷받침하는 근거 이미지로 technical_details 및 results와 직접 연결된다.
Continuous Blur Field(CBF)과 그 크기 맵, CLIP 기반 attention 맵을 시각화해 물리·인지 결합의 동작을 보여준다.

이 패널은 모델 내부에서 학습된 라우팅 토큰 ID 분포와 attention 편차, 블러 필드의 연속성 등을 시각화해 SDSSM이 의미적 특화 영역을 어떻게 할당하는지를 보여준다. 또한 실패 사례를 포함해 CLIP이 의미를 추출하지 못할 때 attention이 균일해지는 현상과 블러 필드 추정의 한계를 직접 관찰할 수 있어 limitations 섹션의 근거를 보강한다. 따라서 이 그림은 모델 내부 동작에 대한 직관적 이해를 제공해 technical_details와 limitations에 중요한 근거가 된다.
토큰 라우팅 맵, attention 지도, 연속 블러 필드 등 내부 중간 표현들을 모아 실패 사례와 정상 동작을 함께 제시한 종합 패널이다.
한계점
논문에서 명시된 제한점은 frozen CLIP 프리어즈에 대한 과도한 의존성이다. 매우 심한 모션 블러로 인해 CLIP이 의미적 단서를 뽑지 못하면 공간 attention이 균일하게 되어 focal adaptation 효과가 소실되고 복원에 실패하는 사례가 보고됐다. 저자들은 향후 작업으로 블러에 강건한 의미 추출기 통합과 비디오 복원 확장을 제시했다.
실무 활용
CogSENet은 경량 설정에서도 고품질 복원을 달성해 실무에서 리소스 제약이 있는 환경에 적용할 수 있다. 연속 Blur Field와 CLIP 기반 공간 주의 모듈은 특정 의미적 객체에 복원 자원을 집중시키므로 OCR 전처리, 보안 카메라 영상 개선, 모바일 사진 품질 향상 등에서 유용하다. 다만 논문 메타데이터 상 공개된 공식 GitHub 링크가 명시되어 있지 않아 실무 도입 시 구현 재현이 필요하다.
- OCR 전처리를 위해 문자 영역을 의미적으로 집중 복원해 판독률을 향상시키는 용도
- 교통·보안 영상에서 비균일한 모션 블러를 제거해 객체 검출·추적 성능을 개선하는 용도
- 모바일·임베디드 환경에서 파라미터 예산을 준수하면서 고품질 사진 복원을 수행하는 용도
코드 공개 여부: 미확인
키워드
용어 해설
- State Space Model (SSM)
- — State Space Model은 시퀀스 데이터를 선형 상태 전파로 모델링해 연산 복잡도를 선형으로 유지하면서 장거리 의존성을 포착하는 방법이다. 입력 토큰을 시간적 순서로 스캔하며 내부 상태를 갱신하고 출력으로 변환하여 긴 범위의 문맥 정보를 전달한다. 본 논문에서는 SDSSM을 통해 시맨틱 그룹 기반의 선택적 스캔을 구현해 이미지 내 비균일 블러를 효율적으로 처리한다.
- Gumbel-Softmax Routing
- — Gumbel-Softmax 라우팅은 이산 클러스터 할당을 연속 근사로 처리해 경사하강법으로 최적화 가능한 토큰 분류를 가능하게 하는 기법이다. 각 토큰에 대해 클러스터 확률 분포를 샘플링하고 기대값으로부터 시맨틱 프롬프트를 구성하여 역전파 경로를 보존한다. CogSENet은 이를 이용해 토큰을 의미별로 재배열하고 SDSSM의 선택적 스캔에 입력한다.
- Wavelet Transform
- — Wavelet Transform은 신호를 서로 다른 주파수 대역으로 분해해 저주파 근사 성분과 고주파 세부 성분을 얻는 수학적 변환이다. 이미지 특징을 LL(저주파)와 H(고주파) 서브밴드로 분리해 각 밴드에 특화된 처리 경로를 적용하면 구조와 텍스처를 물리적으로 분리해 복원 품질을 높일 수 있다. CogSENet의 BFFB는 Haar 계열 웨이브렛을 사용해 명확한 주파수 분리를 수행한다.
- Continuous Blur Field (CBF)
- — Continuous Blur Field는 입력 이미지로부터 예측한 픽셀 단위의 연속적인 변위(flow) 필드로서 공간적으로 비균일한 블러 강도와 방향을 촉진한다. tanh로 바운딩된 연속값을 d_max로 스케일링해 병목 단계의 특징과 결합함으로써 블러에 따른 가중치 조절을 수행한다. CBF는 명시적 블러 인식을 통해 심층 특징의 포컬 어댑테이션을 유도한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.