본문으로 건너뛰기
Databricks Blog조회 1

Databricks, Iceberg v3 지원 공개: 성능과 상호운용성의 한계를 넘다

Databricks가 Iceberg v3 퍼블릭 프리뷰를 통해 삭제 벡터와 VARIANT 등 고성능 증분 처리 및 반정형 데이터 분석 기능을 네이티브로 지원한다.

섹션별 상세

01
기존의 데이터 업데이트 방식은 작은 변경에도 대규모 파켓 파일을 다시 써야 하는 병목 현상이 있었다. Iceberg v3의 삭제 벡터는 논리적 삭제 정보를 별도 파일에 기록함으로써 물리적 재작성 과정을 생략한다. 실제 벤치마크 결과 기존 Copy-on-Write 방식보다 데이터 조작 성능이 최대 10배 향상됨이 확인됐다. 이를 통해 대규모 데이터셋에서도 저지연 업데이트와 삭제가 가능해진다.
행 ID 유무에 따른 데이터 변경 추적 방식 비교 다이어그램
Diagram행 ID가 없을 때는 모든 행이 교체된 것처럼 보이지만, 고유 행 ID를 사용하면 수정, 삭제, 추가된 행을 명확히 식별할 수 있음을 보여줍니다. 이는 증분 처리를 위한 행 계보(Row Lineage)의 핵심 원리를 설명합니다.
삭제 벡터 적용 전후의 삭제 파일 구조 비교
Diagram삭제 벡터가 없을 때는 여러 개의 활성 삭제 파일이 읽기 성능을 저하시키지만, 삭제 벡터를 사용하면 단일 파일로 관리되어 읽기 성능이 향상됨을 시각화합니다.
02
반정형 데이터 처리를 위해 스키마를 강제하거나 문자열로 저장하던 방식은 유연성이나 성능 중 하나를 포기해야 했다. VARIANT 타입은 반정형 페이로드를 관계형 컬럼과 함께 저장하며 SQL로 직접 쿼리할 수 있는 네이티브 환경을 제공한다. 데이터가 진화하더라도 별도의 ETL 파이프라인이나 스키마 마이그레이션 없이 즉시 분석에 활용할 수 있다. 이는 보안 로그나 IoT 데이터처럼 구조가 자주 변하는 데이터 소스 처리에 최적화되어 있다.
VARIANT 컬럼을 사용한 반정형 데이터 저장 예시 표
Screenshot동일한 ORDER 컬럼 내에서 서로 다른 스키마를 가진 JSON 데이터를 VARIANT 타입을 통해 효율적으로 저장하고 성능을 유지하는 방식을 보여줍니다.
03
여러 카탈로그와 엔진을 사용하는 기업 환경에서 데이터 중복과 거버넌스 파편화가 주요 문제였다. Unity Catalog는 오픈 API를 통해 Snowflake, AWS Glue 등 외부 카탈로그와의 양방향 연동을 지원하여 단일 진실 공급원을 유지한다. 행 필터 및 컬럼 마스크와 같은 세밀한 액세스 제어를 한 번 정의하면 모든 연결된 엔진에서 동일하게 적용된다. 데이터 팀은 보안 정책을 중앙에서 관리하면서도 각 업무에 적합한 분석 도구를 자유롭게 선택할 수 있다.
Databricks의 증분 처리 아키텍처 플로우
Diagram다양한 소스에서 유입된 데이터가 Lakeflow Connect를 거쳐 Bronze, Silver, Gold 레이어로 증분 처리되는 메달리온 아키텍처와 Unity Catalog의 역할을 보여줍니다.
Unity Catalog 중심의 양방향 카탈로그 페더레이션 구조
DiagramUnity Catalog가 Snowflake, Salesforce, Microsoft Fabric 등 다양한 외부 플랫폼과 데이터를 주고받으며 표준화된 카탈로그 역할을 수행함을 나타냅니다.
04
Delta Lake와 Iceberg 사이에서 기술적 선택을 고민해야 했던 제약이 UniForm 기술로 해소됐다. UniForm을 사용하면 데이터를 Delta Lake에 한 번만 쓰면 Iceberg 포맷으로도 읽을 수 있어 중복 저장 비용이 발생하지 않는다. Iceberg v3가 Delta의 핵심 성능 기능인 삭제 벡터와 VARIANT를 채택함에 따라 두 포맷 간의 기능 격차가 사라졌다. 금융 서비스 기업 사례에서 이를 통해 고비용의 전체 테이블 복제 서비스를 대체하고 운영 효율을 높인 사례가 보고됐다.

용어 해설

아파치 아이스버그 v3(Iceberg v3)
대규모 데이터 레이크하우스를 위한 오픈 테이블 포맷의 최신 버전이다. 행 수준의 계보(Row Lineage), 삭제 벡터(Deletion Vectors), VARIANT 타입 등을 도입하여 증분 처리 성능과 반정형 데이터 처리 효율을 획기적으로 개선한 것이 특징이다.
삭제 벡터(Deletion Vectors)
데이터를 물리적으로 즉시 삭제하는 대신 삭제된 행의 위치 정보만 별도 파일에 기록하는 기술이다. 대규모 파켓(Parquet) 파일을 다시 쓰는 비용을 줄여 데이터 조작 성능을 최대 10배까지 향상시킨다.
베리언트 타입(VARIANT Type)
JSON과 같은 반정형 데이터를 스키마 변경 없이 효율적으로 저장하고 쿼리할 수 있게 해주는 네이티브 컬럼 타입이다. 유연한 데이터 구조를 유지하면서도 열 지향(Columnar) 저장 방식의 성능 이점을 동시에 제공한다.
변경 데이터 캡처(CDC)
데이터베이스의 소스 데이터 변경 사항을 실시간으로 감지하여 타겟 시스템에 반영하는 기술이다. Iceberg v3에서는 행 ID와 시퀀스 번호를 통해 테이블 자체에서 네이티브하게 이를 지원한다.

기술

  • Apache Iceberg v3
  • Unity Catalog
  • Delta Lake
  • UniForm
  • Snowflake
  • AWS Glue

활용 사례

  • 실시간 CDC 파이프라인 구축
  • 대규모 보안 로그 분석
  • 멀티 엔진 데이터 거버넌스 통합
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 10.수집 2026. 04. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.