본문으로 건너뛰기

AWS와 Vexcel의 멀티모달 임베딩으로 대규모 항공 이미지의 지오스페이셜 검색을 구현한 사례

다중 뷰 항공 영상의 임베딩·캡션링·벡터 검색을 모듈형 아키텍처로 구현하고, Nova 멀티모달 임베딩과 캡션의 결합이 검색 품질에 가장 큰 영향을 준다는 점을 실험으로 확인했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

대규모 항공 영상 데이터를 자연어 질의로 검색하기 위한 멀티모달 임베딩, 캡션링, 다중 뷰 융합의 설계 원리와 실험 결과를 요약한다. 첫째, 서로 다른 뷰를 결합하는 임베딩 모델의 선택이 검색 품질에 큰 차이를 만든다. 둘째, 캡션링을 도입하면 pools와 roads 모두에서 F1 점수가 크게 상승하며, 융합 방식에 따라 최적 구성이 달라지는 점이 확인된다. 셋째, 5가지 검색 전략 중 기본 k-NN이 안정적이면서도, 특정 쿼리에서 메타데이터 필터링과 멀티모드 융합이 비용과 정확도 사이의 트레이드오프를 효과적으로 조절한다. 이 연구의 프레임워크는 새로운 모델의 도입 시 즉시 성능 변화를 측정할 수 있게 해주며, Vexcel Intelligence 같은 생산형 솔루션으로 이어지는 실전 로드맵을 제시한다.

섹션별 상세

지리 공간 이미지의 검색 문제는 한 이미지가 아닌 7개 시점(Orthophoto, 4개 Oblique 각도, DSM, DTM)으로 구성된 다중 뷰 타일의 정보를 함께 해석해야 한다는 점에서 일반 사진 검색과 다르다. 벡터 임베딩과 LLM 캡션링, 그리고 OpenStreetMap 기반의 자동Ground Truth를 결합한 평가 프레임워크의 필요성이 제기되고, Bedrock과 OpenSearch Serverless를 이용한 모듈형 파이프라인으로 다중 뷰 정보를 통합한다. 이 구성은 나중에 Vexcel Intelligence와 같은 생산형 솔루션으로 확장되며, 모델 교체를 구성 변경으로만 처리하는 이식성을 제공한다. 또한 ground truth를 자동화된 데이터 소스로 삼아 반복 가능한 벤치마크를 만든 점이 특징이다.
다층 항공 이미지의 예시로 제시된 항공 건물 이미지
Photo제시된 이미지는 Tile의 다중 시점(Orthophoto 포함) 관찰의 시각적 예시를 보여주며, 본문에서 다중 뷰의 중요성을 설명하는 그림의 예시로 활용된다.
근거
  • Amazon Nova Multimodal Embeddings가 pools와 roads 벤치마크에서 최고 F1 점수를 기록했다. Experiment 1: Which model understands aerial imagery?
실험 1은 임베딩 모델의 효과가 성능에 큰 차이를 만들며, Amazon Nova Multimodal Embeddings가 풀과 도로 벤치마크에서 최고 성능(F1: pools 0.621, roads 0.555)을 기록했다. Cohere Embed v4와의 비교에서는 pools에서 0.606으로 근소한 차이였으나 roads에서 0.415로 큰 차이가 나타났고 Titan Multimodal Embeddings G1은 평균 0.340으로 저조했다. 이는 모델 선택이 기능별로 큰 편차를 만들 수 있음을 시사한다. 생산 환경에서는 Nova를 기본값으로 삼고, 필요 시 다른 모델로 충분히 대체할 수 있음을 시사한다.
실험 2에서는 7개 뷰를 어떻게 융합하느냐에 따라 성능 차이가 크다. per-view 임베딩은 7개 벡터를 각각 유지하는 방안으로 가장 낮은 신뢰성을 보였고, Cohere batch은 pools에서 0.638의 최고 성능을 기록했다. roads의 경우 attention fusion이 0.535로 상위 성능을 보였고, Cohere batch은 0.479로 뒤처졌다. 결과적으로 뷰 융합 전략은 대상 피처에 따라 달라지며, 특정 쿼리에서의 최적 구성이 다름을 확인했다.
실험 3은 캡션링의 효과가 가장 큰 향상을 가져오는 요인임을 보여준다. Nova 2 Lite 기반 캡션과 이미지 임베딩의 결합 구성은 pools에서 0.638의 최고 점수를 달성했고, roads에서도 0.555로 크게 개선됐다. 텍스트만 검색하는 방식은 0.532로 하락했고, DSM/DTM의 추가가 항상 이득을 주지 않는다는 점도 확인됐다. 캡션의 품질 차이가 태그 기반 필터링의 재현성에 영향을 미쳤으며, 따라서 캡션의 어휘 선택이 검색 성능에 직접적으로 작용한다.
Embed & Index 인터페이스의 캡션 생성 컨트롤
Screenshot임베딩 구성과 캡션 생성 옵션이 한 화면에서 조정되는 모습을 보여 주며, 캡션이 검색 품질에 미치는 영향을 직관적으로 제시한다.
실험 4는 5가지 검색 전략의 trade-off를 비교한다. 기본 k-NN은 캡션이 인덱스에 이미 반영된 경우 가장 일관된 성능을 보였고, 이미지+캡션 융합은 시각적·언어적 정보를 함께 활용하는 균형 접근으로 Pools에서 최상위에 올랐다. 메타데이터 필터링은 알려진 피처를 빠르게 찾을 때 가장 유리했고, 텍스트-만 검색은 비용은 낮지만 비효율적이었다. 최적의 방법은 피처 타입에 따라 다르며, 프레임워크를 통해 쿼리 유형별로 최적 구성으로 손쉽게 조정할 수 있다.
Embedding 구성 옵션 화면
ScreenshotEmbedding 모델 선택, 차원 설정, Fusion Strategy 등의 구성을 한 화면에서 조정하는 모습을 보여 주며, 시스템의 모듈형 설계를 강조한다.
종합적으로 이 연구는 Nova 멀티모달 임베딩과 캡션링의 조합이 대규모 지리공간 검색에서 가장 높은 ROI를 제공한다는 점과, 다중 뷰 융합 및 캡션의 조합으로 성능을 대폭 끌어올릴 수 있음을 보여준다. 또한 프레임워크 자체의 모듈화가 새로운 모델의 도입을 용이하게 하며, 생산형 서비스에서의 운영 비용 최적화에도 실질적 도움을 준다.

이미지 분석

Ingestion 인터페이스를 보여주는 스크린샷
Screenshot

Tile 인제스트 단계의 UI를 통해 어떤 이미지를 어떤 레이어로 수집하는지 설정하는 모습을 보여주며, 파이프라인의 데이터 수집 부분을 시각적으로 설명한다.

Ingestion 인터페이스를 보여주는 스크린샷

용어 해설

다중 모달 임베딩(Multimodal Embeddings)
다중 모달 임베딩은 이미지, 텍스트 같은 서로 다른 데이터 소스로부터 정보를 함께 해석해 하나의 벡터 표현으로 통합하고, 이 표현으로 서로 다른 소스 간의 연관성을 빠르게 비교하고 검색하게 하는 기술이다. 본 글의 맥락에서 항공 영상의 여러 뷰를 결합해 위치·특징을 한 벡터에 담아 질의에 따른 검색 정확도와 재현율을 높이는 핵심 메커니즘이다.
캡션 생성(Captioning)
LLM이 이미지의 다중 뷰 정보를 바탕으로 텍스트 설명을 생성하는 과정으로, 시각적 정보의 보완적 언어 표현을 만들어 검색에 활용한다. 이 글에서는 일곱 개 뷰를 동시에 분석해 하나의 통합 설명을 만들어 임베딩과 매칭에 결합하는 방식으로 검색 품질을 크게 개선하는 요인으로 다룬다.
OpenStreetMap 기준 정답(OpenStreetMap Ground Truth)
지리 공간 데이터의 자동 정답원으로 OpenStreetMap 데이터를 활용하는 방식으로, Overpass API를 통해 대규모 벤치마크를 구성하고 검색 정확성을 측정한다.
라이트 융합( Late Fusion )(Late Fusion)
7개의 뷰 임베딩을 먼저 각각 계산한 뒤, 이들 임베딩을 후처리에서 합쳐 하나의 벡터로 만드는 융합 전략이다. 각 뷰의 신호를 보존하면서도 전체 인덱스의 규모를 줄이는 효과가 있다.
kNN 필터링(k-NN Filtering)
쿼리와 임베딩 간의 유사도 기반으로 후보 집합을 먼저 좁힌 뒤 벡터 검색을 수행하는 방법이다. 메타데이터 태그 기반 필터링과 결합해 검색 효율성과 정확도를 조정하는 데 활용된다.

기술

  • Amazon Bedrock
  • Amazon OpenSearch Serverless
  • Nova Multimodal Embeddings
  • Cohere Embed v4
  • Claude
  • Overpass API
  • Vexcel
  • OpenSearch

활용 사례

  • Geospatial semantic search
  • Multi-view imagery search
  • Infrastructure monitoring
  • Urban planning decisions

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.