왜 중요한가
위성 장면은 많은 소규모 인스턴스와 복잡한 겹침 관계를 포함해 일반 자연사진용 조건화 방식으로는 충실도를 유지하기 어렵다. TerraDiT-Ω은 벡터형 원시 프리미티브를 손실 없이 직접 입력으로 사용하므로 지리공간 워크플로와 자연스럽게 호환된다. 이 접근은 단일 생성 모델로 다양한 주석 예산에서 제어 가능한 합성과 downstream 성능 향상을 동시에 달성한다.
핵심 기여
원시 지리공간 프리미티브의 직접 입력을 허용하는 통합 생성 프레임워크
폴리곤, 폴리라인, 바운딩 박스, 포인트를 별도 변환 없이 직접 소비하는 Unified Primitive Encoder를 도입했다. 이 인코더는 Fourier feature와 instance caption을 결합한 포맷별 MLP로 각 프리미티브를 임베딩해 단일 토큰 표현으로 병합한다. 결과적으로 서로 다른 주석 예산을 가진 작업들에서 동일한 아키텍처로 제어 가능한 합성이 가능해졌다.
Geometry-Aware Local Attention으로 기하학적 단서를 attention에 명시적으로 주입
인스턴스별로 회전 가능하고 비등방성인 가우시안 커널을 MetaRBF+가 예측하고, 복잡한 프리미티브에 대해서는 Spatial Geometry Field로 세밀한 공간 제약을 구성했다. 이 두 신호를 곱해 정규화한 K_final을 attention 로그릿에 곱함으로써 포인트는 부드러운 지역 초점, 폴리라인과 폴리곤은 점진적으로 더 날카로운 기하학적 정렬을 유도했다. 그 결과 밀집된 위성 장면에서도 인스턴스 경계와 방향성을 보존한 조건화가 가능해졌다.
단일 모델 기반 합성 데이터로 여러 RS downstream 작업 성능 향상
하나의 통합 아키텍처에서 생성한 합성 데이터로 land-cover segmentation, object detection, road graph extraction, scene classification 등 네 가지 작업에서 개선 효과를 관찰했다. 논문은 다양한 주석 형식과 주석 예산에서 합성 이미지가 실험적으로 downstream 성능을 향상시켰음을 보고했다. 이로 인해 별도 task-specific 생성 파이프라인 없이도 다중 응용을 지원할 수 있다.
핵심 아이디어 이해하기
위성 이미지 합성에서는 다수의 작은 객체가 밀집하고 서로 복잡하게 교차하므로 단순한 축정렬 또는 포인트 기반의 국소화만으로는 인스턴스 형태를 정확히 반영하기 어렵다. 기존 접근은 보통 벡터를 래스터화하거나 점 프롬프트로 대체해 기하학적 세부 정보를 손실하거나 계산 비용을 크게 늘렸다. 따라서 원시 프리미티브의 기하학적 특성을 보존하면서 attention 수준에서 직접 조건화할 방법이 필요하다.
TerraDiT-Ω은 이 문제를 두 층의 공간적 제약으로 해결한다. 첫 층은 MetaRBF+가 예측하는 회전 비등방성 가우시안으로 포인트 중심의 국소화 우선순위를 제공한다. 입력으로 (x_i,y_i)와 MetaRBF+ 예측값 σx, σy, θ가 들어오면 해당 가우시안 커널 K_pt(x,y|g_i)를 계산해 각 픽셀에 대한 확률적 가중치를 얻고, 이 값은 attention 로그릿에 곱해져 시각 토큰과 프리미티브 토큰 사이의 상호작용을 제한한다.
두 번째 층은 복잡한 형식에 대해 Spatial Geometry Field를 적용해 폴리곤, 폴리라인, 박스의 경계 정보를 세밀하게 반영한다. 폴리곤과 박스에는 SDF 기반 sigmoid 변환을 적용해 내부 영역에서 높은 응답을 만들고 폴리라인에는 거리 제곱 기반의 튜브형 대비 함수를 적용해 시각적 두께를 보정한다. 최종적으로 K_final(x,y|g_i)=K_pt(x,y|g_i)*S_final(x,y)/Σ(...) 꼴로 정규화된 prior가 attention에 곱해져 포인트에서부터 폴리곤까지 포맷에 적응하는 그라운딩을 만든다.
방법론
전체 접근은 Latent Diffusion Transformer를 백본으로 사용하고 global text는 cross-attention으로 주입하며 geolocation은 adaptive layernorm을 통해 조건화한다. Unified Primitive Encoder는 각 인스턴스의 폴리곤·폴리라인·박스·포인트를 Fourier feature로 매핑하고 고정된 LongCLIP 텍스트 임베딩과 결합한 뒤 포맷별 MLP를 거쳐 포맷별 피처를 생성하고 이들을 연결해 단일 인스턴스 토큰을 만든다. 결측 프리미티브는 학습된 null embedding으로 대체되어 다양한 입력 조합을 처리할 수 있다.
Geometry-Aware Local Attention(GALA)는 MetaRBF+ 모듈과 Spatial Geometry Field를 결합해 attention을 조절한다. MetaRBF+는 multi-head attention과 MLP로 구성되어 각 인스턴스 토큰에서 σx, σy, θ를 예측하고 softplus를 통해 σ 값을 양수로 보장한다. 계산된 회전 비등방성 가우시안 K_pt는 픽셀 좌표에 대해 지향성 있는 국소 prior를 제공하고, SDF나 거리 기반 함수로 만든 S_final과 곱해져 format-adaptive한 K_final을 형성한다.
학습 절차는 사전학습된 TerraDiT-α로 초기화한 뒤 AdamW로 미세조정하는 방식이다. 논문에서는 총 배치 256과 H100 4장으로 200k 스텝 파인튜닝을 수행했고, 대조 실험에서 베이스(B) 변형을 처음부터 학습한 경우에는 400k 스텝을 사용했다. format-wise dropout을 적용해 다양한 주석 가용성에 대한 강건성을 확보했고 REPA 정렬, DINOv3 인코더, RANGE 지리조건 등의 구성요소를 통합했다.
관련 Figure

이미지는 폴리곤, 폴리라인, 박스, 포인트 각각에 대응하는 기하학적 필드와 가우시안 마스크의 차이를 직관적으로 나타낸다. 특히 폴리라인에 대해 거리 기반 튜브형 필드가 시각적 두께를 보정하는 방식과 포인트 가우시안이 부드러운 초점을 형성하는 방식이 병렬로 제시되어 GALA의 format-adaptive 동작 원리를 보완한다. 이 시각적 비교는 각 프리미티브가 attention prior에 미치는 정성적 효과를 이해하는 데 직접적인 근거를 제공한다.
원시 프리미티브 예시와 MetaRBF+/Spatial Geometry Field가 만들어내는 마스크들이 unified primitive tokens와 latent visual tokens 사이의 cross-attention을 어떻게 정규화하는지 보여준다.
주요 결과
논문은 TerraDiT-Ω이 다양한 프리미티브 조건 형식 전반에 걸쳐 dense-control 및 sparse-control 기준 모델을 일관되게 능가한다고 보고했다. 정성적 샘플에서 폴리곤과 폴리라인의 경계 보존과 방향성 정렬이 개선되어 위성 장면의 밀집 구조 표현이 향상된 것으로 나타났다. 합성 데이터를 사용한 downstream 실험에서는 land-cover segmentation, object detection, road graph extraction, scene classification 네 작업에서 모델 성능이 향상되어 단일 생성기에서 다중 task에 쓸 수 있음을 확인했다.
관련 Figure

그리드 형태의 샘플은 주석 개수가 증가할수록 생성 이미지가 인스턴스 경계와 배치를 더 충실히 따르는 경향을 시각적으로 확인시킨다. 또한 좌우 방향으로 global text와 geolocation 같은 맥락 모달리티가 추가될 때 장면의 전반적 스타일과 지역적 특성이 조정되는 모습을 통해 텍스트·지리 조건의 보완적 역할이 드러난다. 이 정성적 결과는 논문이 주장하는 '다양한 형식에서의 제어성 향상'과 합성 데이터의 downstream 유용성 주장을 보강한다.
다양한 주석 예산과 문맥 모달리티에 따른 정성적 생성 샘플들이 배열되어 있어 조건 복잡도에 따른 합성 품질 변화를 보여준다.
기술 상세
전체 아키텍처는 Latent Diffusion Transformer를 중심으로 Unified Primitive Encoder와 GALA를 결합하는 구조이다. 이미지 잠복 표현과 시각 토큰이 Transformer 내부에서 유지되며 인스턴스 토큰은 cross-attention을 통해 시각 토큰과 상호작용한다. Global text는 cross-attention으로 주입되고 geolocation은 adaptive layernorm을 통해 레이어 정규화에 조건화된다.
MetaRBF+는 인스턴스 토큰으로부터 σx, σy, θ를 예측하는 모듈이며 multi-head attention 다음에 MLP를 배치해 인스턴스 간 상호참조를 허용한다. σ 값에는 softplus를 적용해 양수성을 강제하고 θ는 비제약 상태로 두어 회전 자유도를 보장한다. 예측된 가우시안은 픽셀 좌표에 대해 K_pt를 계산하는데 이때 행렬 곱을 통해 회전 및 비등방성 스케일을 적용하여 픽셀 오프셋(x-x_i, y-y_i)에 대한 거리를 산출한다.
Spatial Geometry Field는 폴리곤과 박스의 경우 SDF를 계산하고 sigmoid(−α·SDF)로 내부 응답을 강조하며 폴리라인의 경우 정규화된 거리 d_line에 대해 h(d)=d^2를 적용한 뒤 exp(−α·h(d))로 튜브형 지지 영역을 생성한다. 포맷 마스크와 format-wise dropout을 통해 활성 필드를 선택하고 이를 K_pt와 곱해 K_final을 얻어 attention 로그릿에 multiplicative modulation을 수행한다. 이 과정은 attention 계산 전에 정규화 분모를 포함해 전체 prior가 확률적으로 해석될 수 있도록 한다.
학습 및 구현 세부사항으로는 TerraDiT-α 초기화, AdamW 학습률 1e-5, 총 배치 256을 H100 4장에서 200k 스텝 미세조정한 점이 있다. 추가적인 대조군은 베이스 변형을 400k 스텝으로 학습했다는 점이 보고되었고 REPA, DINOv3, RANGE, LongCLIP 등의 구성요소가 통합되어 데이터 정렬과 텍스트/지리 조건화를 보완한다.
관련 Figure

이 그림은 프리미티브가 포맷별 MLP와 Fourier feature를 거쳐 단일 인스턴스 토큰으로 결합되는 처리 흐름을 보여준다. MetaRBF+가 가우시안 파라미터를 예측하고 Spatial Geometry Field가 복잡한 프리미티브의 밀집 공간 제약을 생성하여 Geometry-Aware Local Attention이 attention 로그릿을 곱셈으로 조절하는 전체 경로가 도식화되어 있다. 아키텍처 구성 요소의 연결 방식은 입력된 벡터 원시형식을 래스터 변환 없이 직접 attention 기반 조건으로 사용하는 방법의 핵심 메커니즘을 명확히 전달한다.
TerraDiT-Ω 전체 아키텍처 다이어그램으로 Unified Primitive Encoder, MetaRBF+, Spatial Geometry Field, GALA, Latent Diffusion Transformer의 상호작용을 시각화하고 있다.
실무 활용
TerraDiT-Ω은 GeoAI 파이프라인에서 벡터 원시 프리미티브를 바로 입력으로 받아 제어 가능한 위성 이미지 합성을 수행하므로 데이터 확장과 설계 작업에 곧바로 활용 가능하다. 코드와 모델 가중치는 공개 저장소에 있어 연구 및 엔지니어링 목적의 재현과 응용이 용이하다. 다양한 주석 예산을 지원하므로 주석 비용이 제한된 실무 환경에서도 합성 데이터로 downstream 모델을 보강할 수 있다.
- 데이터가 부족한 지역에서 land-cover segmentation 학습을 위한 합성 데이터 생성
- 도로 네트워크 추출 모델을 위한 다양한 폴리라인 두께와 방향성 변형을 포함한 합성 이미지 생성
- 도시 계획 시나리오에서 건물 배치(polygons)와 도로(polylines)를 제어한 합성 장면 생성
- 객체 탐지 모델의 희귀 클래스 보강을 위한 점 및 박스 조건 기반 합성
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 통합 프리미티브 인코더(Unified Primitive Encoder)
- — 폴리곤, 폴리라인, 바운딩 박스, 포인트 같은 서로 다른 지리공간 원시형식을 공통 임베딩 공간으로 변환하는 모듈이다. 각 형식은 Fourier feature와 텍스트 임베딩을 결합한 포맷별 MLP로 인코딩되어 인스턴스 단위 통합 토큰을 생성한다. 이 통합 표현은 이후의 attention 기반 조건화에서 일관된 입력으로 사용된다.
- 사인드 거리장(Signed Distance Field)
- — 폴리곤이나 박스 경계로부터의 거리 값을 내부는 음수, 외부는 양수로 표현한 스칼라 필드이다. 논문에서는 SDF에 sigmoid/softplus 변환을 적용해 내부에서 높은 응답을 얻고 외부에서 급격히 감소하는 공간 기하 필드를 생성한다. 이 필드는 폴리곤 기반의 공간 제약을 attention 로그릿에 곱해 기하학적 정렬을 강화하는 데 사용된다.
- 회전 비등방성 가우시안(Rotated Anisotropic Gaussian)
- — x, y 방향의 표준편차를 독립적으로 학습하고 회전각을 적용해 방향성이 있는 위치 우선순위를 표현하는 가우시안 커널이다. MetaRBF+가 인스턴스별로 σx, σy, θ를 예측하여 포인트 기반의 국소화 우선순위를 형성한다. 이 커널은 축정렬 가우시안 한계를 넘고 길쭉하거나 회전된 객체에 맞춘 attention 정규화를 가능하게 한다.
- 공간 기하 필드(Spatial Geometry Field)
- — 폴리곤, 폴리라인, 박스 등 복합 원시형식에서 기하학적 신호를 밀집된 격자 형태로 표현한 모듈이다. 폴리곤과 박스에는 SDF 기반 sigmoid 변환을 적용하고 폴리라인에는 거리 제곱 기반의 튜브형 대비 함수를 적용해 시각적 두께를 반영한다. 이 필드는 가우시안 우선순위와 곱해져 format-adaptive한 attention 마스크를 만든다.
- Latent Diffusion Transformer
- — 이미지 잠복 공간(latent space)에서 흐름/확산 신경망과 Transformer 기반 cross-attention을 결합한 생성 백본이다. 본 논문에서는 이 백본에 텍스트, 지리정보, 프리미티브 조건을 주입해 위성 이미지 합성을 수행한다. Latent 공간에서 연산하므로 고해상도 이미지를 효율적으로 처리하면서 cross-attention으로 다중 모달 조건을 통합할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.