TL;DR
현행 파노라마 생성 방법은 고품질 360° 데이터를 요구하는 파인튜닝 또는 다단계 최적화를 필요로 하여 계산 비용과 지연이 크다. 이 논문은 사전학습된 diffusion transformer의 위치 인코딩과 가이던스만을 변경해 학습과 최적화 없이 ERP의 위상 제약을 충족시키는 방법을 제시한다. 결과적으로 백본의 모든 내재적 기능을 보존하면서 실시간에 가까운 텍스트-투-파노라마 및 비디오 생성이 가능해졌다.
왜 중요한가
현행 파노라마 생성 방법은 고품질 360° 데이터를 요구하는 파인튜닝 또는 다단계 최적화를 필요로 하여 계산 비용과 지연이 크다. 이 논문은 사전학습된 diffusion transformer의 위치 인코딩과 가이던스만을 변경해 학습과 최적화 없이 ERP의 위상 제약을 충족시키는 방법을 제시한다. 결과적으로 백본의 모든 내재적 기능을 보존하면서 실시간에 가까운 텍스트-투-파노라마 및 비디오 생성이 가능해졌다.
핵심 기여
제로샷·무학습·무최적화 파노라마 생성 프레임워크
사전학습된 diffusion transformer의 가중치를 변경하지 않고도 ERP 파노라마를 생성하는 실행시간(inference-only) 파이프라인을 제시했다. 이 프레임워크는 백본의 조건화 파이프라인과 호환되어 이미지·비디오·오디오-비디오 등 다양한 생성 모달리티에 즉시 적용된다. 비교 실험에서 학습 기반 및 최적화 기반 방법과 경쟁력 있는 성능을 보였고 인간 평가에서도 선호도가 높게 나타났다.
Spherical RoPE로 ERP 위상 불변성 강제
RoPE의 주파수 스펙트럼을 분할해 저주파 채널에는 구면의 3차원 Cartesian 좌표를 삽입하고 고주파 채널에는 기본 주파수의 정수 고조파로 양자화하는 설계를 도입했다. 저주파는 극 수렴과 전역 레이아웃을 강제하고 고주파는 경계에서의 위상 정합을 유지하므로 수평 주기성과 극 수렴이라는 ERP 제약을 동시에 만족했다. 이 방식은 모델 파라미터를 바꾸지 않으면서 토큰 수준의 위치 표현을 구면 위상에 맞게 재구성했다.
Semantic Distortion CFG로 기하학적 유도 추가
기하학적 앵커 프롬프트를 원래 프롬프트에 연결한 세 갈래의 CFG 스키마를 도입했다. 각 디노이징 스텝에서 사용자 조건화(cond), 무조건화(uncond), 기하학적 앵커(geo)의 노이즈 예측을 결합해 최종 노이즈를 산출하며 두 개의 스케일 파라미터로 의미성 및 기하학적 강도를 독립 제어했다. 이 기법은 Spherical RoPE의 하드 제약과 결합될 때 파노라마 전역의 충실도와 경계 일관성을 함께 확보했다.
이미지·비디오 벤치마크와 인간 평가에서의 검증
ODI-SR 이미지 벤치마크와 VBench 기반 비디오 세트에서 제로샷 설정으로 정량적 비교를 수행했다. FLUX.2 백본에서 FAED 등 일부 지표에서 최상위 성능을 달성했고 사용자 선호도 조사에서 대부분의 경쟁 기법 대비 우위를 보였다. 또한 구성 요소별 절단(ablation) 연구를 통해 Spherical RoPE와 SD-CFG의 상호 보완적 효과를 정량적으로 입증했다.
핵심 아이디어 이해하기
360° ERP 파노라마는 구면을 2D 평면에 사영하므로 수평 경계의 완전한 주기성과 극점에서의 모든 열의 수렴이라는 두 가지 위상적 불변성이 존재한다. 기존 RoPE 기반 Transformer는 2D 유클리드 격자 가정을 전제로 하므로 열 인덱스 0과 W가 다른 임베딩을 갖게 되어 수평 주기성을 깨뜨리고, 극에서는 모든 열이 동일 포인트로 수렴해야 하는 요구를 만족시키지 못한다. 이로 인해 생성된 ERP 이미지에 경계 실(seam)이나 극왜곡이 나타난다. Spherical RoPE는 RoPE 스펙트럼을 주파수 대역으로 분할하고 저주파와 고주파에 서로 다른 인코딩을 적용해 이러한 위상 문제를 해결한다. 저주파 대역에서는 각 토큰의 열·행 인덱스를 구면의 위도·경도로 변환한 뒤 3D Cartesian 좌표 X,Y(및 스케일 R)를 계산하여 좌표를 두 채널에 교차 배치함으로써 경계 주기성과 극 수렴을 수학적으로 보장했다. 고주파 대역에서는 인접 픽 간 위상 일관성을 유지하기 위해 각 채널을 기본 주파수의 정수 고조파로 반올림(harmonic quantization)하여 수평 경계에서 위상 정합을 확보했다. 이 분할적 접근은 전역 레이아웃을 담당하는 저주파를 보존하면서도 로컬 텍스처를 담당하는 고주파의 국부적 연속성을 유지하게 해 모델의 원래 시각적 표현 능력을 손상시키지 않는다.
방법론
문제 설정은 ERP의 두 가지 위상 제약, 즉 수평 주기성(C1)과 극 수렴(C2)을 명시적으로 만족시키면서 텍스트 조건성도 유지하는 것이다. 먼저 원본 RoPE 채널마다 ω_i와 기본 주파수 ω_fund=2π/W_tokens의 비율 k_i를 계산하고, k_i가 최소 한 주기를 완성하고 정수 근처인지의 조건으로 스플릿 인덱스 i_split를 결정한다. 그 결과 연속된 주파수 분할이 생성되고 해당 분할에 따라 서로 다른 인코딩 정책을 적용한다. 저주파( i ≥ i_split )에 대해서는 각 토큰의 행 r과 열 c를 위도 θ(r)와 경도 φ(c)로 변환한 뒤 X(r,c)=(cosθ cosφ+1)R, Y(r,c)=(cosθ sinφ+1)R 형태의 Cartesian 좌표를 계산해 짝수·홀수 주파수 슬롯에 교차 삽입함으로써 열의 감싸기(wrap)와 극에서의 수렴을 수치적으로 만족시켰다. 고주파( i < i_split )에 대해서는 각 채널의 주파수를 round(k_i)·ω_fund로 양자화하여 α_i(c)=c·ĥω_i 형태의 선형 인코딩을 유지하되 경계에서 정확한 2π 주기성을 보장했다. 추가로 Semantic Distortion CFG는 각 디노이징 스텝에서 세 가지 노이즈 예측 ε_cond, ε_uncond, ε_geo를 계산하고 ε_hat = ε_uncond + w_sem·(ε_cond - ε_uncond) + γ·(ε_geo - ε_cond) 형태로 결합해 의미적 충실성과 기하학적 유도를 독립적으로 조절하도록 구성했다. 구현 측면에서는 원본 모델의 세로 RoPE 축과 시간 축은 변경하지 않고 가로 축에만 스펙트럼 분할과 좌표 대체를 적용하여 백본의 입력·토크나이저·조건화 파이프라인과 완전 호환되게 설계했다.
주요 결과
정량 평가에서 FLUX.2 백본을 사용한 제로샷 설정이 ODI-SR 데이터셋의 일부 지표에서 최상위 성능을 달성했다. 구체적으로 FLUX.2 기반의 구성은 논문 표에서 FAED 25.40과 멀티뷰 KID/IS 등에서 경쟁력 있는 값들을 보였고 전역 왜곡과 경계 불연속성(Discontinuity Score)에서 우수한 수치로 보고되었다. 비디오 평가에서는 LTX 2.3 백본을 통한 제로샷 파이프라인이 SphereDiff-20 및 Stress-20 벤치마크에서 시간적 안정성, 영상 품질, CLIP 기반 텍스트 정렬 등 여러 지표에서 높은 점수를 얻었다. 사용자 연구에서는 320건의 블라인드 쌍비교에서 논문 방법이 대부분의 경쟁 기법 대비 전반적 선호와 텍스트 정합성 측면에서 우위를 차지했다. 구성 요소 절단 실험에서 Spherical RoPE 단독 적용은 경계 불연속 문제를 해결했으나 일부 전역 품질 지표(FAED)를 악화시켰고, SD-CFG 단독 적용은 전역 품질을 개선했지만 경계 봉합 문제를 완전히 해소하지 못했으며 두 구성 요소를 결합할 때 전체 성능이 균형을 이루는 것으로 보고되었다.
관련 Figure

이 전체 파노라마는 수평 가장자리에서 연속성이 유지된 픽셀 배치를 보여주며 경계 실(seam) 현상이 거의 관찰되지 않는다. 구면 RoPE와 SD-CFG가 결합되어 전역 구조와 지형 윤곽이 자연스럽게 이어지는 결과를 생성했음을 시각적으로 확인할 수 있다. 이 이미지는 제로샷 추론만으로 ERP 위상 제약을 만족시킬 수 있다는 방법론적 주장의 직접적 근거로 활용된다.
논문 제시 예시로서 FLUX 기반으로 생성된 ERP 파노라마의 전체 뷰를 보여준다.

상단의 수평 경계와 하단의 전경 식생이 연속적으로 연결되어 있어 수평 주기성이 유지됨을 시각적으로 확인할 수 있다. 안개와 광원 효과가 극 근처에서도 자연스럽게 표현되어 Spherical RoPE의 극 수렴 특성이 실사용 장면에서도 유효함을 시사한다. 이 예시는 다양한 스타일과 도메인에서의 OOD(Out-Of-Distribution) 일반화 가능성을 보강하는 근거로 사용된다.
식생이 많은 숲 장면을 FLUX 기반 제로샷 파노라마로 생성한 전체 ERP 이미지이다.

수평 방향의 파란 수면과 의자 구성이 경계에서 끊기지 않고 이어지는 점이 관찰되어 고주파 양자화가 경계 봉합에 기여했음을 시사한다. 로컬 텍스처의 보존과 전역 레이아웃의 일관성이 공존하므로 Spherical RoPE의 스펙트럼 분할 원리가 효과적임이 보여진다. 이 이미지는 또한 다양한 조명 조건에서의 성능을 평가하는 근거 자료로 활용된다.
리조트 풀 장면을 FLUX로 생성한 ERP 파노라마 전체 이미지이다.

이 관점 크롭은 원본 ERP에서 특정 영역을 투영한 결과로, 극 근처의 기하학적 왜곡 없이 텍스처와 조명이 일관되게 유지되는지를 보여준다. 크롭의 경계 품질이 높아 전역 ERP에서의 위상 보존이 국부적 관점으로도 전달됨이 확인된다. 이러한 크롭 이미지는 논문의 정량적 멀티뷰 메트릭(예: KID, IS) 계산 시 사용되는 관찰 단위를 나타낸다.
산악 일몰 파노라마에서 재투영한 관점 크롭으로서 전경 능선과 일몰 광원이 포함되어 있다.

이 크롭은 전경의 지형 디테일 보존이 우수함을 보여 주며 고주파 채널의 로컬 텍스처 보전이 작동함을 시사한다. 경계에서의 색상·형태 연속성이 유지되어 Spherical RoPE가 전역의 위상적 제약을 지키면서도 로컬 정보를 훼손하지 않음을 보강한다. 이러한 관점 크롭들은 멀티뷰 기준의 정량 비교에서 모델의 지역적 리얼리즘을 평가하는 근거로 활용된다.
같은 산악 파노라마에서 추가로 캡처한 관점 크롭으로 전경과 중경의 지형이 포함되어 있다.

전경 수목의 밀도와 그림자 표현이 자연스럽게 유지되어 시간적·공간적 일관성이 훼손되지 않음을 보여준다. 로컬 위상 정합성 유지가 전역 ERP의 성공적 생성과 직결됨을 시각적으로 확인할 수 있다. 이 이미지는 제로샷 방식이 다양한 스케일에서 기하학적 무결성을 유지함을 보이는 증거로 활용된다.
해당 파노라마의 또 다른 관점 크롭으로 하단 전경과 수목이 포함되어 있다.

안개로 인한 원근 흐림과 수직 수목의 반복 구조가 안정적으로 표현되어 구면 인코딩이 원근과 조도 변화에 대해 현실적인 결과를 유도했음을 시사한다. 특히 극 방향의 왜곡이 최소화되어 ERP의 수렴 조건이 실전 장면에서도 유지된다는 근거를 제공한다. 이러한 크롭은 기하학적 왜곡에 민감한 장면에서의 성능을 점검하는 데 유용하다.
아마존 캐노피 파노라마에서 재투영한 관점 크롭으로 안개와 고목들이 포함되어 있다.

중심부의 구조적 요소가 연속성 있게 표현되어 이미지-조건화(image-conditioned) 시나리오에서도 정체성·스타일 보존이 가능한 점을 시사한다. 이 크롭은 논문에서 주장한 '플러그앤플레이' 조건화 기능이 실제로 파노라마 전체에 걸쳐 유지됨을 시각적으로 보강하는 자료이다. 결과적으로 이 그림들은 방법의 일반화 성능과 실무적 적용 가능성을 함께 뒷받침한다.
같은 숲 파노라마에서 중앙 초점의 관점 크롭으로 데크나 보행로가 포함될 수 있는 장면 구성이다.
기술 상세
전체 아키텍처 변경은 RoPE의 가로 축 인코딩에 국한되어 백본의 다른 모듈과 가중치는 유지된다. 가로 토큰 수 W_tokens와 세로 H_tokens 관계는 ERP 표준(W=2H)을 전제로 하며, 각 열 인덱스 c는 φ(c)=2π c / W_tokens − π로, 각 행 인덱스 r는 θ(r)=π r/(H_tokens−1) − π/2로 변환된다. 저주파 채널에서는 θ와 φ를 이용해 X,Y 좌표를 계산하고 이 좌표를 RoPE의 even/odd 슬롯에 교차 배치해 좌표 중심의 거리·위상 정보를 주입한다. 수식적으로 X(r,c)=(cosθ(r)cosφ(c)+1)R, Y(r,c)=(cosθ(r)sinφ(c)+1)R로 계산되며 R은 스케일 종속 반지름이다. 고주파 채널에서는 각 채널의 주파수 ω_i를 기본 주파수 대비 비율 k_i로 표준화한 뒤 ĥω_i=round(k_i)·ω_fund를 사용해 α_i(c)=c·ĥω_i 형태의 선형 주파수 인코딩을 유지함으로써 국부적 텍스처 위상 정합을 확보한다. Semantic Distortion CFG는 세 방향 노이즈 예측을 결합하는데, 최종 예측은 ε_uncond에 의미성 스케일 w_sem와 기하학 스케일 γ로 조정된 차분 항을 더한 선형 조합으로 산출된다. 실험 세팅에서는 ODI-SR(1,200 장의 ERP 파노라마)와 SphereDiff-20 / Stress-20 비디오 프롬프트 세트를 사용했고, 정량 평가는 FAED, DS, FID, KID, IS, CLIP Mean 및 VBench의 시간·주제 일관성 지표를 포함했다. 추가로 LLM 기반 지각 평가와 인간 사용자 연구를 수행해 정성적 품질을 보완했다.
한계점
Spherical RoPE만 단독 적용하면 전역 구조 제약은 해결되지만 일부 전역 품질 지표(논문에서는 FAED 증가로 보고됨)가 악화되는 경향이 있다. 고주파를 고조파로 양자화하면 수평 주기성은 확보되지만 해당 서브스페이스에서는 극 수렴(C2)을 완전하게 만족하지 않으며 이 제한은 저주파의 지배적 영향에 의해 완화되는 것으로 보고되었다. 논문은 이러한 트레이드오프를 SD-CFG와 결합해 보완했으나 여전히 구성 요소별 파라미터(w_sem, γ 등)에 민감성이 존재함을 실험적으로 지적하고 있다.
실무 활용
제안된 프레임워크는 사전학습된 diffusion transformer에서 추론 단계만 수정하므로 기존 모델의 조건화·이미지-입력 파이프라인을 그대로 활용할 수 있다. 이 점은 이미지→파노라마 변환, 텍스트→파노라마 정적 이미지 생성, 그리고 텍스트→파노라마 비디오·오디오 생성에 즉시 적용 가능하다는 의미이다. 공개된 구현(https://github.com/orhir/SpheRoPE)이 존재하므로 연구자와 개발자가 실제 워크플로에 통합해 실험을 재현하거나 파이프라인을 확장하는 것이 용이하다.
- 가상현실(VR)용 360° 환경을 신속하게 생성해 프로토타입 장면을 제작하는 용도
- 일반 이미지나 참고 이미지를 입력으로 받아 원활하게 이어지는 전방위 파노라마로 변환하는 콘텐츠 제작 파이프라인
- 텍스트 기반 시나리오로부터 시간적 일관성을 갖춘 360° 비디오와 동기화된 오디오를 생성해 몰입형 시뮬레이션을 만드는 연구·엔터테인먼트 응용
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Rotary Position Embedding (RoPE)
- — Transformer의 토큰 간 상대적 위상을 주입하는 위치 인코딩 방식이다. 주파수 채널별로 선형 위상 이동을 적용해 토큰 간 거리를 표현하며, 원래의 RoPE는 유클리드 격자에 맞춰 설계되어 ERP의 수평 주기성과 극 수렴성을 보장하지 못한다.
- Equirectangular Projection (ERP)
- — 구면을 2D 직사각형으로 펼치는 표준 파노라마 표현 방식이다. 경도(φ)를 가로축, 위도(θ)를 세로축으로 매핑하며 왼쪽·오른쪽 경계의 주기성과 위·아래 극점의 수렴이라는 두 가지 위상적 제약을 유발한다.
- Classifier-Free Guidance (CFG)
- — 텍스트 조건화된 노이즈 예측과 무조건 노이즈 예측의 선형 결합으로 생성 방향을 조절하는 기법이다. 가중치 조절을 통해 생성물의 조건 준수도와 다양성 간 균형을 조절할 수 있으며 본문에서는 이를 기하학적 앵커와 결합했다.
- Diffusion Transformer (DiT)
- — Transformer 구조를 기반으로 확률적 노이즈 제거 과정을 적용하여 이미지를 생성하는 모델 계열이다. RoPE 기반의 공간 인코딩과 self-attention을 사용하므로 위치 인코딩 변경만으로도 ERP 위상 제약을 조정할 수 있다.
- Harmonic Quantization
- — 연속 주파수 성분을 가장 가까운 정수배 기본 주파수로 반올림해 주기성을 강제하는 기법이다. ERP의 수평 주기성을 보장하기 위해 RoPE의 고주파 채널에 적용되어 경계에서 위상 정합을 확보한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.