본문으로 건너뛰기

시각적 합성을 위한 생성적 정제 네트워크

기존 확산 모델은 복잡도와 상관없이 동일한 연산량을 소모해 비효율적이었고, 자기회귀 모델은 이산 토큰화 과정의 정보 손실로 품질 한계가 있었다. 이 논문은 계층적 이진 양자화와 글로벌 정제 메커니즘을 통해 효율성과 고품질 생성을 동시에 달성하며 이미지 및 비디오 생성의 새로운 방향을 제시한다.

왜 중요한가

기존 확산 모델은 복잡도와 상관없이 동일한 연산량을 소모해 비효율적이었고, 자기회귀 모델은 이산 토큰화 과정의 정보 손실로 품질 한계가 있었다. 이 논문은 계층적 이진 양자화와 글로벌 정제 메커니즘을 통해 효율성과 고품질 생성을 동시에 달성하며 이미지 및 비디오 생성의 새로운 방향을 제시한다.

핵심 기여

Generative Refinement Networks (GRN) 프레임워크

글로벌 정제 메커니즘과 복잡도 인식 생성 기능을 갖춘 차세대 시각 합성 프레임워크를 제안하여 견고하고 효율적인 시각적 생성을 구현했다.

Hierarchical Binary Quantization (HBQ) 기법

이산 토큰화의 병목 현상을 해결하기 위해 이론적으로 무손실에 가까운 계층적 이진 양자화 방식을 도입하여 연속적 표현과 대등한 재구성 품질을 확보했다.

엔트로피 가이드 샘플링 전략

생성 과정에서 시각적 콘텐츠의 난이도에 따라 연산 자원을 동적으로 할당하는 엔트로피 기반 스케줄링 함수를 통해 적응형 단계 생성을 가능하게 했다.

이미지 및 비디오 생성 SOTA 달성

ImageNet 256x256 벤치마크에서 rFID 0.56, gFID 1.81을 기록하며 신기록을 세웠고, 1024x1024 고해상도 텍스트-이미지 및 텍스트-비디오 생성으로 확장 가능성을 입증했다.

핵심 아이디어 이해하기

기존의 시각적 생성 모델은 두 가지 큰 벽에 부딪혀 있었다. 확산 모델은 노이즈를 제거하는 과정에서 모든 이미지에 똑같은 횟수의 연산을 수행하므로 단순한 배경을 그릴 때도 복잡한 피사체를 그릴 때만큼의 자원을 낭비한다. 반면, 언어 모델처럼 토큰을 하나씩 예측하는 자기회귀 모델은 한 번 잘못 예측한 토큰이 다음 토큰에 영향을 주어 오류가 누적되지만, 이를 나중에 수정할 방법이 없었다.

GRN은 사람이 그림을 그리는 방식에서 영감을 얻어 이 문제를 해결한다. 먼저 HBQ라는 기법을 통해 이미지를 아주 작은 이진 비트의 계층 구조로 압축한다. 이는 마치 정밀한 격자판 위에 점을 찍는 것과 같아서, 비트가 추가될수록 오차가 지수적으로 줄어들어 원본과 거의 차이가 없는 수준까지 복잡한 시각 정보를 담아낼 수 있다.

핵심은 '글로벌 정제' 과정에 있다. 모델은 처음에 무작위로 채워진 토큰 맵에서 시작하여, 매 단계마다 전체 화면을 훑으며 불확실한 부분을 지우고 다시 그리거나 더 정교하게 다듬는다. 이 과정에서 엔트로피(불확실성)를 측정하여, 이미 충분히 잘 그려진 부분은 빠르게 넘어가고 복잡한 부분에는 더 많은 정제 단계를 할당함으로써 연산 효율과 시각적 완성도를 동시에 잡았다.

방법론

전체적인 접근 방식은 계층적 이진 양자화(HBQ)를 통한 시각적 토큰화와 이를 기반으로 한 생성적 정제 네트워크(GRN)의 결합으로 구성된다. HBQ는 VAE 인코더의 특징 맵을 [-1, 1] 범위로 매핑한 뒤, 여러 라운드의 이진 결정을 통해 정보를 압축한다.

HBQ 메커니즘은 각 라운드 j에서 양자화 오차 e_j가 1/2^j 미만이 되도록 설계되었다. 입력값 F와 현재 버킷 중심 c_i가 주어질 때, F > c_i이면 1, 아니면 0을 출력하는 연산을 수행한다. 이 결과값 q_i에 2^-i를 곱해 누적함으로써 특징을 재구성하며, 라운드가 반복될수록 오차가 지수적으로 감소하여 무손실에 가까운 압축을 달성한다.

GRN의 학습은 무작위 토큰 맵 Ft에서 시작하여 정답 토큰 Ygt를 예측하도록 훈련된다. Ft = St * Yt + (1 - St) * Yrand 식을 사용하는데, 여기서 St는 이진 선택 맵으로 현재 단계에서 유지할 토큰과 무작위로 대체할 토큰을 결정한다. 모델은 이 혼합된 상태를 입력받아 전체 토큰 맵을 예측하며, 이 과정에서 자연스럽게 오류를 수정하고 빈 곳을 채우는 능력을 학습한다.

추론 시에는 엔트로피 가이드 샘플링을 적용한다. 각 단계 t에서 예측 확률 분포의 평균 엔트로피 H(Yt)를 계산한다. 엔트로피가 낮으면 모델의 확신이 높다는 의미이므로 정제 단계를 줄이고, 엔트로피가 높으면 더 많은 단계를 할당하여 세밀하게 보정한다. 이를 통해 샘플의 복잡도에 따라 20~50단계 사이에서 가변적으로 추론을 수행한다.

관련 Figure

생성 단계(10, 30, 50단계)에 따른 텍스트-이미지 생성 결과의 질적 차이를 보여준다.
Photo

엔트로피 가이드 샘플링을 통해 단순한 이미지는 적은 단계(10단계)로도 충분한 품질을 얻고, 복잡한 텍스트나 세밀한 묘사가 필요한 이미지는 더 많은 단계(50단계)를 거쳐 완성됨을 보여준다.

생성 단계(10, 30, 50단계)에 따른 텍스트-이미지 생성 결과의 질적 차이를 보여준다.

주요 결과

ImageNet 256x256 재구성 실험에서 HBQ(M=4)는 rFID 0.56을 기록하여 기존 SD-VAE(0.87)나 VAR(0.85)을 크게 앞질렀다. 특히 4배 더 높은 압축률에서도 연속적 표현 기반 모델보다 우수한 성능을 보였으며, 8라운드 설정에서는 연속적 베이스라인과 거의 동일한 품질을 구현했다.

클래스 조건부 이미지 생성(C2I) 벤치마크에서는 GRN-G(2B 파라미터) 모델이 gFID 1.81을 달성하며 기존 SOTA인 DiT-XL/2(2.27)나 LlamaGen-XXL(2.34)을 능가했다. 130M 규모의 소형 모델인 GRN-B조차 FID 3.56을 기록하여 227M 규모의 MaskGIT(6.18)보다 뛰어난 효율성을 입증했다.

텍스트-이미지(T2I) 및 텍스트-비디오(T2V) 확장 실험에서도 강력한 성능을 보였다. GenEval 벤치마크에서 0.76점을 기록하며 대규모 확산 모델들과 대등한 수준의 프롬프트 준수 능력을 보였고, VBench 비디오 평가에서도 82.99점을 획득하여 2B라는 상대적으로 작은 파라미터 수로도 고품질의 동영상 생성이 가능함을 증명했다.

관련 Figure

HBQ 라운드 수 증가에 따른 rFVD, LPIPS, SSIM, PSNR 지표의 변화를 나타낸 그래프이다.
Chart

HBQ 라운드가 4에서 8로 증가함에 따라 모든 재구성 지표가 개선되며, 8라운드에서 양자화가 없는 연속적 베이스라인(검은 점선) 수준에 도달함을 보여준다. 이는 계층적 이진 양자화가 정보 손실을 효과적으로 억제함을 입증한다.

HBQ 라운드 수 증가에 따른 rFVD, LPIPS, SSIM, PSNR 지표의 변화를 나타낸 그래프이다.

GRN의 텍스트-비디오 생성 결과물로, 인물 동작과 사물 상호작용이 포함된 여러 장면을 보여준다.
Photo

계란을 깨서 그릇에 담는 복잡한 물리적 상호작용이나 인물의 자연스러운 시선 처리를 통해 GRN이 높은 수준의 시각적 일관성과 품질을 유지하며 비디오를 생성할 수 있음을 확인시켜 준다.

GRN의 텍스트-비디오 생성 결과물로, 인물 동작과 사물 상호작용이 포함된 여러 장면을 보여준다.

기술 상세

GRN 아키텍처는 FlexAttention을 지원하는 Transformer 구조를 기반으로 하며, 130M에서 2B까지 다양한 스케일로 구현되었다. 기존의 인덱스 예측 방식(GRNind)과 비트 예측 방식(GRNbit)을 모두 지원하며, 실험 결과 대규모 모델에서는 비트 예측이 토큰 에일리어싱 문제를 완화하여 더 우수한 성능을 보였다.

HBQ 토크나이저는 3D 인과적 VAE 구조를 채택하여 이미지와 비디오를 통합된 잠재 공간에서 처리한다. 이미지 전용 토크나이저는 OpenImages 데이터셋으로, 통합 토크나이저는 공개 이미지 및 비디오 데이터셋의 혼합으로 학습되었다. 특히 GAN 손실 가중치를 정교하게 튜닝하여 재구성 충실도와 지각적 품질 사이의 최적의 균형점을 찾았다.

글로벌 정제 메커니즘은 MaskGIT과 같은 마스크 기반 모델과 차별화된다. 기존 모델은 한 번 확정된 토큰을 고정하지만, GRN은 매 단계마다 모든 토큰을 다시 예측하고 확률적으로 업데이트함으로써 이전에 발생한 오류를 소급하여 수정할 수 있는 능력을 갖췄다. 이는 학습 시 무작위 토큰 샘플링 전략을 통해 구현되었다.

관련 Figure

인덱스 예측 방식과 비트 예측 방식의 비디오 생성 품질을 비교한 이미지이다.
Photo

비트 예측 방식이 인덱스 예측 방식보다 아티팩트가 적고 더 선명한 비디오를 생성함을 시각적으로 보여준다. 이는 비트 단위의 명시적 감독 신호가 토큰 에일리어싱 문제를 완화한다는 저자의 주장을 뒷받침한다.

인덱스 예측 방식과 비트 예측 방식의 비디오 생성 품질을 비교한 이미지이다.

한계점

제한된 컴퓨팅 자원으로 인해 모델 크기를 최신 대형 시각 생성 모델 수준으로 확장하지 못했다. 또한 텍스트-비디오 생성 작업에서 인간 관련 시나리오의 성능은 우수하지만, 생성된 비디오가 때때로 풍부한 시각적 세부 사항이 부족하거나 왜곡을 보이는 경우가 존재한다.

실무 활용

GRN은 높은 압축 효율과 가변적 연산 비용을 제공하므로, 자원이 제한된 환경에서의 고품질 이미지/비디오 생성 서비스에 적합하다. 특히 자기회귀 구조임에도 글로벌 정제가 가능해 기존 AR 모델의 고질적인 문제인 오류 누적을 실무적으로 해결했다.

  • 모바일 기기 등 저사양 하드웨어에서의 적응형 고해상도 이미지 생성
  • 실시간에 가까운 프레임 정제가 필요한 텍스트 기반 비디오 합성 서비스
  • 무손실에 가까운 압축이 필요한 의료 또는 정밀 산업 이미지 재구성 시스템

코드 공개 여부: 공개

코드 저장소 보기

키워드

GRN(생성적 정제 네트워크)HBQ(계층적 이진 양자화)AR(자기회귀 모델)Diffusion(확산 모델)Visual-Synthesis(시각적 합성)Adaptive-Sampling(적응형 샘플링)
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 14.수집 2026. 04. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.