TL;DR
Databricks는 VLDB 2026에서 AI agent workload에 맞춘 데이터베이스와 Lakehouse 아키텍처의 변화를 발표합니다. Lakebase는 serverless PostgreSQL compute를 cloud object storage와 분리하고 Copy-on-Write branching, sub-second cold starts, live data 분석을 지원하며, LakehouseRT와 결합해 LTAP 기반을 형성합니다. Apache Spark Structured Streaming은 microbatch pipelining으로 throughput을 최대 3배 높였고, AutoLiquid는 평가된 workload의 95% 이상에서 고객 선택 key를 앞섰으며, Ultron은 median join latency를 25% 개선했습니다. Enzyme의 incremental view maintenance 시연까지 포함해 트랜잭션, 스트리밍, 자동 최적화를 하나의 agent-native data infrastructure 방향으로 묶습니다.
섹션별 상세
이미지 분석

도식의 Gen 1은 Database Engine과 저장소가 하나의 상자에 함께 있는 모놀리식 구조이고, Gen 2는 Proprietary Storage와 Database Engine을 분리하지만 서로 강하게 연결된 구조입니다. Gen 3 Lakebase는 Open Data Lake를 공통 저장 기반으로 두고 Postgres, Spark, AI Agents가 독립적으로 연결되도록 구성해 본문의 storage-compute separation과 LTAP 구상을 시각화합니다.
데이터베이스 아키텍처가 모놀리식 구조에서 compute와 storage를 느슨하게 분리한 구조를 거쳐 Lakebase의 완전한 분리 구조로 진화하는 과정을 나타낸 도식입니다.
용어 해설
- 온라인 트랜잭션 처리(OLTP)
- — OLTP는 짧고 빈번한 트랜잭션을 낮은 지연으로 처리하는 데이터베이스 방식입니다. Lakebase는 PostgreSQL 연산 계층과 저장소를 분리해 기존 모놀리식 OLTP 엔진이 처리하기 어려운 대규모 분기 데이터베이스와 에이전트 작업을 지원합니다.
- Copy-on-Write 브랜칭(Copy-on-Write Branching)
- — Copy-on-Write Branching은 원본 데이터를 즉시 복제하지 않고 변경된 부분만 새로 기록해 데이터베이스 분기를 만드는 방식입니다. Lakebase는 이 구조로 Git과 유사한 데이터베이스 작업 흐름과 짧은 수명의 분기 데이터베이스를 지원합니다.
- Micro-Batch Processing
- — Micro-Batch Processing은 스트리밍 입력을 작은 배치로 묶어 반복 처리하는 방식입니다. Apache Spark Structured Streaming은 이 구조를 기반으로 확장성, 장애 내성, exactly-once semantics를 확보하고 파이프라이닝으로 처리량을 최대 3배 높였습니다.
- Exactly-Once Semantics
- — Exactly-Once Semantics는 장애나 재시도가 발생해도 각 이벤트의 처리 결과가 한 번만 반영되도록 보장하는 처리 특성입니다. Structured Streaming이 대규모 스트리밍 작업에서 데이터 중복과 누락을 줄이는 핵심 특성으로 제시됩니다.
- Materialized View
- — Materialized View는 질의 결과를 저장해 반복 조회 때 원본 데이터를 다시 계산하지 않도록 만든 구체화된 뷰입니다. Enzyme은 데이터 변경분을 증분적으로 반영해 데이터 엔지니어링 작업에서 뷰를 유지하는 엔진으로 소개됩니다.
- Lake Transactional Analytical Processing(LTAP)
- — LTAP는 트랜잭션 처리와 분석 처리를 하나의 시스템에서 결합하는 데이터 처리 패러다임입니다. Databricks는 Lakebase와 LakehouseRT를 조합해 열린 데이터 레이크 저장소 위에서 실시간 분석과 트랜잭션 처리를 연결하는 구조를 제시합니다.
기술
- Lakebase
- PostgreSQL
- cloud object storage
- open formats
- Apache Spark Structured Streaming
- microbatch pipelining
- stateful APIs
- CLUSTER BY AUTO
- AutoLiquid
- Ultron
- Enzyme
- LakehouseRT
- Reyden engine
활용 사례
- AI agent의 짧고 깊게 분기되는 데이터베이스 workflow
- live transactional data에 대한 low-latency analytics
- 대규모 스트리밍 작업의 exactly-once 처리
- 수백만 개 Lakehouse table의 자동 clustering key 선택
- 반복적인 analytical workload의 history-based query optimization
- 데이터 엔지니어링 workload의 incremental materialized view maintenance
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.