본문으로 건너뛰기

Amazon Quick의 멀티 데이터셋 Topics 기능으로 교차-데이터셋 NLQ 지원

Amazon Quick의 멀티 데이터셋 Topics는 최대 12개의 데이터셋과 명시적 관계를 하나의 시맨틱 레이어로 결합해 NLQ 엔진이 자동으로 조인된 SQL을 생성하도록 하여 데이터 정규화를 유지한 채 통합 응답을 제공한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Amazon Quick의 멀티 데이터셋 Topics는 기존의 단일 평탄화된 데이터셋 모델이 요구하던 비정규화 방식 대신 하나의 토픽에 최대 12개의 데이터셋을 연결하고 명시적 관계를 정의하여 NLQ 엔진이 자동으로 관련 칼럼을 찾고 필요한 SQL 조인을 생성하도록 한다. 이 기능은 데이터 정규성을 유지하면서 중앙 거버넌스를 지키고 동일한 시맨틱 레이어를 챗 기반 질의와 분석 시각화에 재사용할 수 있게 하며, 프라이빗 프리뷰에서는 SPICE 데이터셋을, 퍼블릭 프리뷰에서는 Direct Query를 통한 외부 소스 연결 확장을 지원한다고 명시되어 배포와 실시간성 요구에 따라 선택이 가능하다. 결과적으로 사용자는 스키마를 알 필요 없이 자연어로 복합적 질문을 던져 통합된 응답을 얻을 수 있고, 데이터 준비 부담과 중복 관리를 줄이면서도 런타임에서 생성되는 조인 로직의 정확성과 거버넌스 유지를 기대할 수 있다.

섹션별 상세

01
QuickSight의 초기 데이터 모델은 서로 다른 소스 테이블을 하나의 평탄화된 데이터셋으로 결합하는 비정규화 전략을 사용해 런타임 조인을 회피함으로써 쿼리 응답성을 확보했다. 이 방식은 간단한 케이스에서 성능 이점을 가져왔으나 데이터 중복과 중앙 거버넌스 관리의 비효율을 초래했다. 결과적으로 복잡한 스키마를 가진 조직에서는 데이터 준비 단계에서 조인 정의와 테이블 병합을 수동으로 수행해야 했고 이로 인해 유지보수와 확장성이 저해되었다. 이러한 제약이 멀티 데이터셋 Topics 도입의 배경이 되었다.
02
멀티 데이터셋 Topics는 하나의 Topic에 최대 12개의 데이터셋을 추가하고 데이터셋 간의 명시적 관계를 정의할 수 있게 해 NLQ 엔진이 사용자 질문에 대해 어떤 데이터셋의 어떤 칼럼이 관련 있는지 식별하도록 한다. 엔진은 정의된 관계를 따라 필요한 조인을 구성하고 적합한 SQL 쿼리를 생성하여 통합된 답변을 반환하므로 사용자는 기반 스키마를 알 필요 없이 자연어로 질의할 수 있다. 이 과정은 데이터의 정규화를 유지하며 거버넌스를 중앙에서 관리할 수 있게 하고, 동일한 Topic을 챗 기반 질의와 시각화 분석 양쪽에서 재사용할 수 있다는 장점을 제공한다.
03
아키텍처는 데이터 소스 계층, 데이터셋 보강 계층, 멀티-데이터셋 토픽이라는 통합 시맨틱 계층, 그리고 챗 에이전트나 분석 시트 같은 소비 계층으로 구성되어 있다. 프라이빗 프리뷰에서는 SPICE 기반 데이터셋을 지원하고 퍼블릭 프리뷰에서는 Amazon Redshift, Amazon Athena, Amazon S3 Tables 등에 대한 Direct Query 확장이 제공될 예정이라고 명시되어 있어 배포 방식과 실시간성 요구에 따른 선택이 가능하다. 챗 에이전트는 토픽에 정의된 관계를 자동으로 횡단하여 교차-데이터셋 쿼리를 생성하므로 분석가는 별도 조인 로직을 작성하지 않고도 복합적 질문에 대한 응답을 얻을 수 있다.
데이터 소스에서 보강된 데이터셋을 통해 멀티-데이터셋 토픽을 구성하고 챗과 분석으로 소비하는 전반적 아키텍처 플로우를 도식화한 다이어그램이다.
Diagram이미지는 네 개의 계층(데이터 소스, 데이터셋 보강, 멀티-데이터셋 토픽, 소비)을 시각적으로 연결해 토픽이 메타데이터·동의어·관계·커스텀 지침을 포함하는 통합 시맨틱 레이어임을 보여준다. 또한 토픽이 여러 데이터셋을 포함하고 정의된 관계를 통해 NLQ 엔진이 조인을 생성하여 챗 에이전트와 분석 시트로 결과를 전달하는 흐름을 명확히 나타낸다.

용어 해설

시맨틱 레이어(Semantic Layer)
원시 테이블과 비즈니스 사용자 간의 의미적 추상화 계층으로, 메타데이터·비즈니스 규칙·관계 정보를 보유해 자연어 질의를 해석하여 정확한 분석 쿼리로 변환하는 역할을 한다. 이 계층은 사용자가 스키마를 알지 못해도 의도에 맞는 칼럼을 찾고, 테이블 간 관계를 따라 적절한 조인을 구성할 수 있게 하는 핵심 구성요소이다. Quick의 Topics는 이 시맨틱 레이어를 확장해 여러 데이터셋을 하나의 의미 단위로 연결한다.
자연어 질의(Natural Language Query)
사용자가 자연어로 질문을 입력하면 의도와 관련 칼럼을 식별하고, 내부적으로 SQL 같은 분석 쿼리로 변환하여 실행결과를 반환하는 기능이다. NLQ 엔진은 메타데이터와 관계 정보를 활용해 어떤 데이터셋을 조회하고 어떤 조인이 필요한지를 결정하며, 질문의 문맥에 따라 필터·집계·정렬을 생성한다. Quick의 챗 에이전트는 NLQ 엔진을 통해 정의된 관계를 자동으로 횡단하여 교차-데이터셋 질의를 생성한다.
SPICE
QuickSight의 인메모리 병렬 계산 엔진으로, 데이터셋을 메모리에 로드하여 대화형 시각화와 빠른 집계 처리를 가능하게 하는 저장·처리 계층이다. SPICE는 사전 집계와 병렬 처리를 이용해 런타임 조인을 줄이고 대시보드 응답성을 개선하는 목적이었다. 멀티 데이터셋 Topics는 프라이빗 프리뷰에서 SPICE를 지원하는 한편, 퍼블릭 프리뷰에서 Direct Query 확장을 제공한다.
비정규화(Denormalization)
여러 소스 테이블을 하나의 평탄화된 테이블로 병합하여 런타임 조인을 제거하고 쿼리 성능을 개선하려는 데이터 준비 전략이다. 비정규화는 단순한 데이터 모델에서 응답성을 높였지만, 데이터 중복과 거버넌스 복잡성, 유지보수 비용을 증가시켰다. Quick의 기존 접근법은 비정규화된 단일 테이블로 데이터셋을 표현했으나 멀티 데이터셋 Topics는 정규화 상태를 유지하면서 교차-데이터셋 질의를 가능하게 한다.
Direct Query
데이터를 미리 인메모리에 로드하지 않고 소스에서 실시간으로 질의하는 방식으로, 소스 데이터의 최신성을 유지하면서도 즉시 분석을 가능하게 한다. Direct Query는 대용량 원본에 대해 SPICE와 달리 실시간 결과를 요구하는 워크로드에서 유용하며, 퍼블릭 프리뷰에서 Quick의 멀티 데이터셋 Topics가 확장 지원을 제공한다고 명시되었다. 이 방식은 런타임 조인과 네트워크 대기시간을 관리해야 하는 트레이드오프가 존재한다.

기술

  • SPICE
  • Amazon Redshift
  • Amazon Athena
  • Amazon S3 Tables

활용 사례

  • 교차-데이터셋 자연어 질의로 통합된 답변 제공
  • 하나의 시맨틱 레이어를 재사용하는 대시보드 및 챗 기반 분석
  • 데이터 정규성을 유지한 상태에서의 중앙 거버넌스 운영
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 08.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.