본문으로 건너뛰기

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution

이미지 초해상화에서 생성 priors는 고주파 디테일의 재현을 해치며, 평면적(ℓ2) 노이즈 가정은 자연 이미지의 주파수적 특성과 불일치를 초래한다. 본 논문은 Sobolev Spectral Rectification으로 노이즈를 컬러링하고, Adversarial Manifold Guidance로 현실적 아티팩트를 대상으로 하는 정보를 학습 신호로 활용하여 faithful한 구조적 디테일과 스펙트럴 일치를 달성하고, Downstream 태스크에서도 성능 향상을 보인다.

왜 중요한가

이미지 초해상화에서 생성 priors는 고주파 디테일의 재현을 해치며, 평면적(ℓ2) 노이즈 가정은 자연 이미지의 주파수적 특성과 불일치를 초래한다. 본 논문은 Sobolev Spectral Rectification으로 노이즈를 컬러링하고, Adversarial Manifold Guidance로 현실적 아티팩트를 대상으로 하는 정보를 학습 신호로 활용하여 faithful한 구조적 디테일과 스펙트럴 일치를 달성하고, Downstream 태스크에서도 성능 향상을 보인다.

핵심 기여

Sobolev Spectral Rectification (SSR)

노이즈 전이 커널을 Σs로 재구성하여 최적화 기하를 Sobolev 공간으로 재정렬한다. 이로써 로그-가능도가 ∥γ∥^2_Hs와 같은 Sobolev 노름의 차로 표현되며, 고주파 불일치를 억제하고 주파수 가중치를 반영한다.

Adversarial Manifold Guidance (AMG)

AMG는 현실적 artefact의 매니폴드를 학습하는 파라메트릭 adversary를 도입해 on-the-fly로 semantically aligned hard negatives를 합성하고 S-DPO의 정보량을 강화한다.

AS-DPO: Adversarial Sobolev Direct Preference Optimization

AS-DPO는 Sobolev Energy Gap ΔEHs를 근거로 한 로지스틱 손실을 사용해 winner와 loser 간의 선호를 학습한다. 이를 통해 고주파 디테일의 복원력을 유지하면서 perceptual 품질을 향상시킨다.

Riesz Representation Theorem 기반 이론적 근거

Σs를 통한 Sobolev gradient의 정의와 최적 Sobolev descent 방향의 유도는 Riesz Representation의 공간 이론에 의거해 구성된다.

실험적 성과 및 일반화

합성 및 real-world SR 벤치마크에서 LPIPS/DISTS 등 perceptual 지표에서 우수하지만, SSIM 등 구조적 지표도 양호하게 유지한다. Downstream Tasks(OCR, Object Detection, Semantic Segmentation)에서.semantic 정합성과 faithful한 재구성의 이점을 보였다.

핵심 아이디어 이해하기

출발점: Flow Matching 기반 조건부 SR에서 x0(백색 노이즈)에서 x1(고해상도 영상)으로 가는 경로를 추정한다. 일반적으로 가정하는 가우시안 노이즈가 동일한 스펙트럼을 갖는다는 점에서 Euclidean 기하를 따르게 되고, 이는 자연 이미지의 주파수 분포(저주파 우세)에 맞지 않아 고주파 디테일이 훼손될 위험이 있다. SSR은 Σs를 통해 노이즈 공분산을 주파수 의존적으로 색칠(color)하고, Sobolev inner product를 사용해 최적화 기하를 Hs 공간으로 재구성한다. ΔEHs를 정의해 정책의 주파수 가중치에 따른 성능 차이를 측정하고, S-DPO를 통해 이상적 후보와의 차이를 최소화한다. AMG는 표준 데이터샘플의 한계를 극복하기 위해 Realistic artefact 매니폴드를 모사하는 parametric adversary를 도입한다. 이는 xw_t에서 xa_t로의 경로를 semantically aligned하게 변형하는 velociy 필드를 예측하고, 동일한 잡음 realization을 재투사해 두 경로를 같은 잡음 환경에서 비교한다. 이를 통해 Sobolev 경사 하에서의 worst-case perturbation 방향을 학습 네트워크가 근사하도록 유도한다. 실험적으로 SSR+AMG의 결합은 고주파 텍스처의 자연스러운 유지와 구조적 일치를 달성하며 Real-world SR 벤치마크에서도 LSD/spectral fidelity 지표에서 우수한 성능을 보인다. 또한 downstream tasks에서도 개선된 성능이 확인된다.

관련 Figure

Fig. 2-3 수준의 개념 도해로, isotropic Euclidean 공간과 Sobolev 공간의 차이 및 ASASR의 Sobolev 정렬 아이디어를 시각적으로 표현한다.
Diagram

주파수-의존적 노이즈 색칠이 최적화 기하를 Sobolev 공간으로 이행시키는 과정과, DPO 방향의 한계를 극복하는 방법을 직관적으로 보여준다.

Fig. 2-3 수준의 개념 도해로, isotropic Euclidean 공간과 Sobolev 공간의 차이 및 ASASR의 Sobolev 정렬 아이디어를 시각적으로 표현한다.

방법론

  1. 전체 접근: Flow Matching 기반 conditional SR에서 x0(다중채널 잡음)에서 x1(고해상도)로의 경로를 학습한다. 2) Sobolev Spectral Rectification: Σs를 정의하고 q(xt−Δt|xt,x1) 및 pψ(xt−Δt|xt,c)의 공분산을 I에서 Σs로 바꿔 로그 가능도를 ∥γ∥^2_Hs의 차로 재표현한다. 3) Sobolev Energy Gap: ΔEHs(xt,c) := ∥γθ(xt,c)∥^2_Hs − ∥γref(xt,c)∥^2_Hs로 정의하고, LS-DPO(θ) = −E[...] log σ(β(ΔEHs(xl_t,c) − ΔEHs(xw_t,c))) i를 도출한다. 4) Adversarial Manifold Guidance: AMG를 학습해 xw_t에서 xa_t로의 경로를 잘못된 해석으로 이끄는 vφ를 예측하고, xat = (1−t)x0 + t xb_a1처럼 noise realization을 공유해 semantic alignment를 보장한다. 5) Hard negative의 Sobolev 제약: δt∗ = −εt Σs ∇x JL2 / ||Σs ∇x JL2||Hs로 최적 방향을 도출하며, 이는 Sobolev gradient의 자연스러운 방향으로의 descent를 보장한다. 6) 구현상의 세부: F를 DCT-II로 구현하고 Neumann 경계조건을 적용, LoRA(r=16, α=16)으로 FLUX.1-dev 백본을 미세조정, β를 2000으로 설정, s를 1.5로 설정한다. 데이터로는 DIV2K/LSDIR을 Real-ESRGAN 파이프라인과 RealSR/DRealSR로 평가한다. 7) 학습 및 추론: 8 GPU에서 학습, 28-step 샘플링으로 추론 속도/품질의 균형을 맞춘다.

관련 Figure

Fig. 3 계열 도해로 SSR으로 noise를 color하고 AMG로 모델의 아티팩트 분포를 학습하는 흐름을 나타낸다.
Diagram

SSR+AMG의 공동 작동이 Sobolev 경사를 효과적으로 활용하는지 시각적으로 보여주며, AS-DPO의 학습 방향성과 연결된다.

Fig. 3 계열 도해로 SSR으로 noise를 color하고 AMG로 모델의 아티팩트 분포를 학습하는 흐름을 나타낸다.

주요 결과

  1. 벤치마크: DIV2K-Val에서 ASASR은 PSNR 20.60, SSIM 0.6171, LPIPS 0.2784, DISTS 0.2088, MANIQA 0.6519, MUSIQ 71.40, CLIPIQA+ 0.7521로 최상위에 근접 혹은 우수한 수치를 보였고 RealSR에서도 PSNR 24.09, SSIM 0.7221, LPIPS 0.2497, DISTS 0.1986, CLIPIQA+ 0.7200 등에서 상위권으로 나타났다. LSDIR-Val에서 LSDIR 중간 지표보다 우수했고 RealLQ250 및 Bringing Old Films Back to Life 등의 real-world 데이터에서도 비슷한 우수성을 보였다.
  2. 다운스트림 태스크: COCO OCR/Object Detection/Instance Segmentation/Semantic Segmentation에서 ASASR이 최상위 혹은 근접한 성능을 달성했다.
  3. 애블레이션: Sobolev Guidance 단독보다 AMG+SSR의 결합이 perceptual 품질과 구조적 fidelity를 동시에 향상시켰고, Euclidean Guidance 대비 Sobolev Guidance의 우수성이 확인되었다. Table 3의 수치에 따르면 Sobolev Guidance 단독이 PSNR 20.60, SSIM 0.6171으로 Full 모델과 동일하거나 더 나은 결과를 보여주었으며, Adversarial DPO Alignment 역시 동일하게 우수한 결과를 보였다. 서로 다른 구성의 Ablation은 SSR+AMG의 조합이 최적의 trade-off를 제공한다.

관련 Figure

대상 부정 샘플의 시각화(텍스트 왜곡, 건물 왜곡 등)으로, hard negatives의 시각적 특성 및 구조적 특성을 보여준다.
Diagram

AMG를 통해 합성된 부정 샘플이 모델의 Sobolev 경사를 실제 구조적 실패 모드에 맞춰 유도하는 중요한 시각적 증거를 제공한다.

대상 부정 샘플의 시각화(텍스트 왜곡, 건물 왜곡 등)으로, hard negatives의 시각적 특성 및 구조적 특성을 보여준다.

기술 상세

  1. 아키텍처: Flow Matching 기반 Conditional SR에서 vθ를 학습하고, Σs로 잡음 공분산을 대체해 Sobolev 공간으로 매핑한다. 2) 이론적 근거: Sobolev inner product ∥γ∥^2_Hs를 로그-가능도 차로 사용하고, ΔEHs로 정책의 주파수 에네르기 차이를 표현한다. 3) 차별점: 기존의 ℓ2 기반 DPO는 스펙트럼 불일치를 야기하며, SSR은 주파수에 따른 악성 고주파 보상을 억제하고 AMG를 통해 본질적 아티팩트를 다루는 방향으로 학습 신호를 확장한다. 4) 구현: DCT-II 기반 F로 주파수 도메인을 다루고 Neumann 경계 조건, LoRA를 활용한 미세조정, β=2000, s=1.5, 28-step 샘플링. 5) 실험 구성: DIV2K/LSDIR/TRACK Real-ESRGAN 파이프라인으로 synthetic 및 real-world 벤치마크를 구성하고, Downstream 태스크에서의 일반화 성능도 제시한다. 6) 이론적 한계 및 확장: Sobolev 파라미터 s의 변화에 따른 균형이 존재하며, s=1.5가 최적의 trade-off로 제시된다.

실무 활용

ASASR은 Sobolev 기반 기하학적 제약과 adversarial한 포용적 negative 샘플링으로 현실적인 아티팩트를 억제하는 SR 방법이다. Real-world degradations 하에서도 spectral fidelity를 유지하면서 구조적 충실도를 높이도록 설계되었다.

  • 고해상도 복원에서 텍스처의 잔상 및 주파수 분포를 보존하고자 하는 스마트폰 촬영의 디지털 줌 개선
  • 현장 영상 복원 및 아카이브 보존에서 자연스러운 질감 유지 + 구조적 일치 필요 시
  • 실시간 혹은 대용량 영상 스트림에서 artifacts를 줄이면서 세부 디테일 유지가 필요한 영상 편집/보정 파이프라인
  • OCR/객체 인식 등 고수준 비전 태스크 전처리에서 텍스트 및 경계의 선명도 보존

코드 공개 여부: 공개

코드 저장소 보기

키워드

Sobolev-Spectral RectificationAdversarial Manifold GuidanceAS-DPOFlow MatchingRiesz Representation TheoremSpectral FidelityReal-World SR

용어 해설

Sobolev 공간(Sobolev Space)
Hs(Ω)는 주파수 영역에서 (1 + ||ω||^2)^s로 가중된 Fourier 계수의 제곱합이 유한한 함수들의 공간이다. 본 연구에서 이 공간의 내적은 Sobolev 노름으로 정의되어 주파수별 에너지 분포를 보다 엄격히 제어하며, 최적화의 기하학을 주파수 의존적으로 재구성하는 기초로 작용한다.
라이젝스 표현 정리(Riesz Representation Theorem)
히르베르트 공간에서 선형 함수가 고유한 벡터로 나타난다는 정리로, 본 연구에서 Sobolev gradient를 정의하고 자연스러운 기하학적 방향으로의 변환에 근거를 제공한다.
Σs (Sobolev 공분산)(Sigma_s (Sobolev Covariance))
Σs = F^{-1} diag((1 + ||ω||^2)^{-s}) F. 역연산 Σs^{-1}은 γ의 Sobolev 노름 ∥γ∥^2_Hs를 구현하는 선형 변환으로 작동한다.
S-DPO(S-DPO (Sobolev Direct Preference Optimization))
Sobolev 에너지 갭 ΔEHs를 이용한 로지스틱 손실 기반의 선호 최적화로, 고주파 디테일의 보존을 촉진하는 방향으로 파라미터를 갱신한다.
Adversarial Manifold Guidance
AMG는 이미지 복원에서 현실적 artefact의 매니폴드를 포착하는 파라미터화된 적대적 네트워크로, 난이도 높은 부정 샘플을 즉시 합성하여 AS-DPO의 학습 신호를 강화한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 22.수집 2026. 05. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.