본문으로 건너뛰기

Databricks가 VLDB 2026에서 공개하는 AI 시대 데이터베이스 구조

Databricks가 Lakebase와 자동화된 Lakehouse 최적화를 VLDB 2026에서 공개합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Databricks는 VLDB 2026에서 AI agent workload에 맞춘 데이터베이스와 Lakehouse 아키텍처의 변화를 발표합니다. Lakebase는 serverless PostgreSQL compute를 cloud object storage와 분리하고 Copy-on-Write branching, sub-second cold starts, live data 분석을 지원하며, LakehouseRT와 결합해 LTAP 기반을 형성합니다. Apache Spark Structured Streaming은 microbatch pipelining으로 throughput을 최대 3배 높였고, AutoLiquid는 평가된 workload의 95% 이상에서 고객 선택 key를 앞섰으며, Ultron은 median join latency를 25% 개선했습니다. Enzyme의 incremental view maintenance 시연까지 포함해 트랜잭션, 스트리밍, 자동 최적화를 하나의 agent-native data infrastructure 방향으로 묶습니다.

섹션별 상세

01
Databricks는 VLDB 2026에서 Lakebase, Apache Spark Structured Streaming, Lakehouse 최적화와 관련된 논문 네 편을 발표할 예정입니다. Reynold Xin의 기조연설은 데이터베이스 공학의 세 번째 황금기를 AI agents의 등장과 연결하고, Lakebase와 LTAP라는 두 가지 아키텍처 패러다임을 제시합니다. 이는 트랜잭션 처리와 분석 처리에 요구되는 구조가 AI agent workload에 맞춰 바뀌고 있음을 보여주는 행사 구성입니다.
02
Lakebase는 serverless PostgreSQL compute와 storage를 분리하고, 데이터와 write-ahead log를 open format으로 cloud object storage에 직접 저장합니다. 이 구조는 sub-second cold starts와 Copy-on-Write branching을 제공하며, millions of short-lived, deeply branched databases처럼 기존 모놀리식 OLTP 엔진이 감당하기 어려운 작업 패턴을 겨냥합니다. 동시에 live transactional data 위에서 low-latency analytics를 실행할 수 있어 AI agent workflow의 트랜잭션과 분석 요구를 한 저장 기반으로 연결합니다.
03
Apache Spark Structured Streaming은 고유한 micro-batch processing 구조를 바탕으로 확장성, fault tolerance, exactly-once semantics를 확보하며 Databricks에서 매주 millions of jobs를 처리합니다. 아키텍처 진화 과정에서 microbatch pipelining은 throughput을 최대 3배 높였고, 새로운 stateful APIs는 복잡한 business logic 표현을 단순화했으며, fine grained access control도 지원하게 됐습니다. 스트리밍 시스템이 실제 고객 환경의 규모와 제어 요구를 충족하려면 처리 방식뿐 아니라 상태 관리와 접근 제어까지 함께 발전해야 한다는 흐름입니다.
04
AutoLiquid는 수백만 개의 Lakehouse table에서 최적의 clustering key를 수동으로 고르는 병목을 CLUSTER BY AUTO primitive로 자동화합니다. key selection heuristics와 efficient shadow verification을 결합해 테이블을 클러스터링하고, 평가된 workload의 95% 이상에서 고객이 선택한 key보다 나은 성능을 냈습니다. Ultron은 반복되는 analytical workload의 실행 이력을 저장하고 join operator 같은 optimizer 선택에 활용해 production workload의 median join latency를 25% 줄였습니다.
05
LakehouseRT는 새로운 Reyden engine을 기반으로 open lake storage에서 직접 real-time low-latency analytics를 수행하도록 설계됐습니다. Lakebase가 serverless PostgreSQL 트랜잭션 처리를 맡고 LakehouseRT가 실시간 분석을 맡는 조합은 두 처리 방식을 LTAP 시스템으로 결합하는 기반이 됩니다. Databricks는 VLDB 2026에서 Enzyme의 incremental view maintenance 시연과 함께 이 agent-native data infrastructure 구상을 엔지니어링·연구팀 및 채용팀과 공유할 예정입니다.

이미지 분석

데이터베이스 아키텍처가 모놀리식 구조에서 compute와 storage를 느슨하게 분리한 구조를 거쳐 Lakebase의 완전한 분리 구조로 진화하는 과정을 나타낸 도식입니다.
Diagram

도식의 Gen 1은 Database Engine과 저장소가 하나의 상자에 함께 있는 모놀리식 구조이고, Gen 2는 Proprietary Storage와 Database Engine을 분리하지만 서로 강하게 연결된 구조입니다. Gen 3 Lakebase는 Open Data Lake를 공통 저장 기반으로 두고 Postgres, Spark, AI Agents가 독립적으로 연결되도록 구성해 본문의 storage-compute separation과 LTAP 구상을 시각화합니다.

데이터베이스 아키텍처가 모놀리식 구조에서 compute와 storage를 느슨하게 분리한 구조를 거쳐 Lakebase의 완전한 분리 구조로 진화하는 과정을 나타낸 도식입니다.

용어 해설

온라인 트랜잭션 처리(OLTP)
OLTP는 짧고 빈번한 트랜잭션을 낮은 지연으로 처리하는 데이터베이스 방식입니다. Lakebase는 PostgreSQL 연산 계층과 저장소를 분리해 기존 모놀리식 OLTP 엔진이 처리하기 어려운 대규모 분기 데이터베이스와 에이전트 작업을 지원합니다.
Copy-on-Write 브랜칭(Copy-on-Write Branching)
Copy-on-Write Branching은 원본 데이터를 즉시 복제하지 않고 변경된 부분만 새로 기록해 데이터베이스 분기를 만드는 방식입니다. Lakebase는 이 구조로 Git과 유사한 데이터베이스 작업 흐름과 짧은 수명의 분기 데이터베이스를 지원합니다.
Micro-Batch Processing
Micro-Batch Processing은 스트리밍 입력을 작은 배치로 묶어 반복 처리하는 방식입니다. Apache Spark Structured Streaming은 이 구조를 기반으로 확장성, 장애 내성, exactly-once semantics를 확보하고 파이프라이닝으로 처리량을 최대 3배 높였습니다.
Exactly-Once Semantics
Exactly-Once Semantics는 장애나 재시도가 발생해도 각 이벤트의 처리 결과가 한 번만 반영되도록 보장하는 처리 특성입니다. Structured Streaming이 대규모 스트리밍 작업에서 데이터 중복과 누락을 줄이는 핵심 특성으로 제시됩니다.
Materialized View
Materialized View는 질의 결과를 저장해 반복 조회 때 원본 데이터를 다시 계산하지 않도록 만든 구체화된 뷰입니다. Enzyme은 데이터 변경분을 증분적으로 반영해 데이터 엔지니어링 작업에서 뷰를 유지하는 엔진으로 소개됩니다.
Lake Transactional Analytical Processing(LTAP)
LTAP는 트랜잭션 처리와 분석 처리를 하나의 시스템에서 결합하는 데이터 처리 패러다임입니다. Databricks는 Lakebase와 LakehouseRT를 조합해 열린 데이터 레이크 저장소 위에서 실시간 분석과 트랜잭션 처리를 연결하는 구조를 제시합니다.

기술

  • Lakebase
  • PostgreSQL
  • cloud object storage
  • open formats
  • Apache Spark Structured Streaming
  • microbatch pipelining
  • stateful APIs
  • CLUSTER BY AUTO
  • AutoLiquid
  • Ultron
  • Enzyme
  • LakehouseRT
  • Reyden engine

활용 사례

  • AI agent의 짧고 깊게 분기되는 데이터베이스 workflow
  • live transactional data에 대한 low-latency analytics
  • 대규모 스트리밍 작업의 exactly-once 처리
  • 수백만 개 Lakehouse table의 자동 clustering key 선택
  • 반복적인 analytical workload의 history-based query optimization
  • 데이터 엔지니어링 workload의 incremental materialized view maintenance
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.