왜 중요한가
시각적 조건을 가진 이미지와 비디오 생성에서 사이드 네트워크가 조건 제어를 담당하지만 그 학습 신호는 암묵적이어서 수렴이 느리고 조건 충실도가 떨어지는 문제가 존재한다. 이 논문은 사이드 네트워크의 중간 피처를 우도 스코어 근사치와 직접 정렬함으로써 조건 신호를 명시적으로 강화하고 학습 효율을 개선했다. 결과적으로 학습 단계에서 수렴 가속과 최종 합성 품질 개선이 동시에 관찰되었다.
핵심 기여
사이드 네트워크 역할을 스코어 분해 관점으로 규정한 이론적 고찰
듀얼-브랜치 패러다임을 무조건적 스코어와 우도 스코어의 합으로 분해했다. 이 분해를 통해 메인 네트워크는 무조건적 스코어에 대응하고 사이드 네트워크는 우도 스코어의 보정 신호를 제공함이 수학적으로 정리되었다. 해당 관점은 사이드 네트워크에 대한 직접적 정규화 설계로 이어졌다.
우도 스코어 정렬을 목적함수에 추가한 LISA 규제 기법
학습 도중 메인 네트워크를 조건 주입 없이 한 번 순전파해 무조건 스코어를 얻고, 클린 샘플 기반의 조건부 스코어와의 차이를 우도 스코어 근사치로 계산했다. 사이드 네트워크의 특정 중간 레이어 피처를 경량 디코더로 스코어 공간으로 매핑한 뒤 디코더 출력과 우도 스코어 근사치 간 제곱 오차를 추가 손실로 도입했다. 이 추가 규제는 사이드 네트워크에 직접적인 보조 그래디언트를 제공하여 수렴 속도와 조건 충실도를 동시에 개선했다.
다양한 아키텍처와 데이터 유형에 걸친 실험으로 효능 검증
T2I-Adapter, ControlNet, DiT 기반 모델과 이미지 및 영상 조건들에서 실험을 수행하여 일관된 성능 이득을 보였다. 특히 pose, segmentation, depth, low-resolution 복원 등 네 가지 이미지 조건에서 학습 초기 단계에서의 성능과 최종 성능이 모두 개선되었다. 또한 추가 파라미터 및 메모리 오버헤드는 거의 없고, 추론 시에는 보조 디코더를 버리므로 비용이 증가하지 않는다.
핵심 아이디어 이해하기
조건부 확산 생성에서 목표는 시간 t에서의 조건부 점수와 무조건 점수의 조합으로 샘플을 역전달하는 것이다. 이때 무조건 점수는 사전학습된 메인 네트워크가 근사하고, 사이드 네트워크는 조건에 따른 잔차 보정을 담당한다. 잔차 보정 항은 베이즈 규칙에 의해 우도 스코어로 표현되며, 사이드 네트워크가 정확히 이 우도 스코어를 학습하면 조건 충실도가 향상된다는 관찰이 출발점이다.
방법론
우도 스코어 근사치는 클린 샘플에 대한 조건부 스코어에서 무조건 스코어를 뺀 샘플별 차이로 구성된다. 구체적으로 먼저 클린 샘플 기준의 denoising 타깃 ∇_{x_t} log p_t(x_t|x_0)을 얻고, 메인 네트워크를 조건 주입 없이 순전파하여 s_θ(x_t,t)을 계산한다. 이 둘의 차이를 우도 스코어 근사치로 삼아 사이드 네트워크의 특정 중간 레이어 출력 r^k_φ(x_t,c,t)를 경량 디코더 D_ψ로 스코어 공간으로 사상한 값과 정렬 목표로 삼는다.
관련 Figure

다이어그램은 첫 번째 순전파에서 조건 없이 메인 네트워크로부터 무조건 스코어를 얻고 두 번째 순전파에서 조건 주입된 사이드 네트워크 피처를 훅하여 디코더로 맵핑하는 구체적 연산 순서를 보여준다. 우도 스코어 근사 공식과 LISA 정규화 항이 어떻게 계산되어 최종 손실에 더해지는지 구조적으로 연결되어 있어 방법론의 구현 포인트를 명확히 확인할 수 있다.
학습 과정에서의 두 차례 순전파로 우도 스코어를 근사하고 디코더로 정렬하는 절차를 단계별로 정리한 플로우 다이어그램이다.
주요 결과
이미지 조건들에서 LISA는 학습 초기 단계에서 수렴을 가속하며 최종 품질을 향상시켰다. 예를 들어 pose 조건에서는 ControlNet 대비 초기 단계에서 PCK가 대폭 개선되었고, depth 조건에서는 더 적은 학습 반복으로 더 나은 FID와 RMSE를 얻었다. 아블레이션에서 정렬 깊이와 가중치 λ의 선택이 성능에 민감함이 관찰되었고, 기본 구성으로 depth=5와 λ=0.2가 균형을 이루었다.
관련 Figure

왼쪽 도식은 메인 네트워크가 무조건 스코어를 담당하고 사이드 네트워크가 우도 스코어를 제공하는 역할 분해를 시각적으로 요약한다. 오른쪽 그래프는 ControlNet에 LISA를 적용했을 때 훈련 반복 대비 PCK 성능이 더 빠르게 상승하며 특정 지점에서 약 2.78배 빠른 수렴 이득이 관찰된다는 것을 수치로 보여준다. 이 Figure는 방법의 동기와 성능 이득을 직관적으로 연결한다.
듀얼-브랜치 아키텍처 도식과 학습 수렴 그래프를 함께 제시한 Figure이다.

원·좌측 열은 입력 조건을, 중앙과 우측 열은 각각 베이스라인과 LISA 적용 결과를 배치하여 조건 충실도 차이를 시각적으로 확인하게 한다. 강조된 영역에서는 LISA가 구조적 제어나 세부형상 보존 면에서 더 일관된 결과를 산출함이 관찰되며 이는 정량 지표와의 정합성을 보강한다.
다양한 조건별 정성적 생성 예시를 ControlNet 및 T2I-Adapter 대비 LISA 적용 결과와 함께 비교한 그리드 이미지이다.

시계열 프레임을 비교하면 LISA 적용 모델이 후속 프레임에서 포즈 및 신체 부위 위치를 더 일관되게 유지하는 경향이 관찰된다. 이 결과는 LISA가 이미지뿐 아니라 비디오 조건 제어에서도 프레임 일관성과 조건 충실도를 함께 개선함을 시사한다.
포즈 비디오 조건에서 ControlVideo와 LISA 적용 모델의 프레임별 생성 결과를 비교한 예시이다.
기술 상세
전체 아키텍처는 동결된 메인 네트워크와 학습 가능한 사이드 네트워크로 구성되며, 사이드 네트워크의 선택된 중간 레이어 출력을 메인 네트워크의 대응 레이어에 feature addition으로 주입한다. 우도 스코어 정렬을 위한 경량 디코더 D_ψ는 합성곱과 활성화 및 업샘플링 계층으로 구성되며 일반적으로 사이드 네트워크 파라미터의 약 0.1퍼센트 규모이다. 학습 손실은 표준 denoising 손실과 LISA 정규화 항의 합으로 정의되며, 정규화 항은 stop-gradient를 사용해 목표 우도 스코어의 그라디언트 전파를 차단한다.
한계점
아블레이션 결과 우도 스코어 정렬 깊이와 정규화 가중치 λ에 따라 성능 편차가 발생하여 하이퍼파라미터 튜닝이 필요하다. 우도 스코어 근사는 단일 샘플의 denoising 타깃과 무조건 스코어 차이에 기반하므로 근사 잡음이 포함될 수 있으며 이로 인해 일부 조건에서 과도한 제약이 발생할 수 있다. 또한 본 접근은 쌍으로 이루어진 (x_0,c) 데이터가 요구되므로 라벨링이나 페어 데이터가 부족한 도메인에서는 적용이 제한될 수 있다.
실무 활용
LISA는 기존의 듀얼-브랜치 계열 모델에 손쉽게 통합될 수 있으며, 학습 시간 단축과 조건 충실도 향상을 동시에 제공한다. 추가적인 추론 비용은 발생하지 않으며 훈련 시에만 경량 디코더와 정렬 손실이 적용된다. 공개된 저장소를 통해 구현 세부사항과 재현 코드를 확보할 수 있다.
- 사전학습된 Stable Diffusion 기반의 조건 이미지 생성 파이프라인에서 학습 초기 수렴을 가속하기 위해 도입할 수 있다.
- 다중 조건을 조합하는 합성 시나리오에서 사이드 네트워크의 피처를 더 분리된 형태로 학습시켜 구성적 제어 성능을 개선하는 데 활용할 수 있다.
- 조건부 비디오 생성 파이프라인에 적용하여 프레임 일관성과 조건 충실도를 동시에 개선하는 데 활용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 우도 스코어(Likelihood Score)
- — 조건부 생성 관점에서 관찰된 조건이 현재 노이즈 상태를 얼마나 더 잘 설명하는지를 나타내는 그래디언트 벡터이다. 이 값은 조건부 점수와 무조건 점수의 차이로 계산되며, 사이드 네트워크가 생성 방향을 조정할 책임을 지는 신호로 사용된다. LISA에서는 이 값을 표적 타깃으로 삼아 중간 피처와 정렬시킨다.
- 듀얼-브랜치 패러다임(Dual-branch Paradigm)
- — 사전학습된 메인 네트워크는 고품질의 무조건적 점수를 유지하고 별도의 사이드 네트워크는 시각적 조건을 인코딩하여 중간 피처를 메인 네트워크에 주입하는 구조이다. 이 구조는 조건 제어를 달성하면서 메인 네트워크를 동결해 효율을 얻는 방식으로 널리 사용된다. 논문에서는 이 구조를 점수 분해 관점으로 해석하여 사이드 네트워크의 역할을 명확히 했다.
- 스코어 매칭(Score Matching)
- — 데이터의 로그밀도 그래디언트인 스코어를 예측하도록 네트워크를 학습시키는 기법이다. 노이즈 수준 t에서의 조건부 또는 무조건적 스코어를 타깃으로 하여 제곱 오차를 최소화하면 역방향 확산 또는 ODE 샘플링에 사용할 수 있는 스코어 추정기가 얻어진다. LISA는 이 스코어 관점에서 사이드 네트워크의 중간 피처를 우도 스코어로 정렬한다.
- 플로우 매칭(Flow Matching)
- — 확률 분포 간의 운송 과정을 직접 학습하기 위해 시간에 따른 벡터장 또는 속도를 매칭하는 방법이다. 이 방식은 diffusion의 SDE/ODE 관점과 유사한 목표를 가지며, 일부 실험에서 DiT와 OT-FM 같은 flow matching 기반 모델에도 LISA가 적용되었다. 논문은 flow matching과 diffusion 모두에 대해 정렬 기법의 효과를 보고했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.