챕터별 상세
신규 데이터 커넥터 및 Jira 통합
Microsoft Dynamics 365, Jira, Confluence, Salesforce(증분 로드 지원), Meta Ads, NetSuite 등 다양한 엔터프라이즈 소스를 위한 신규 커넥터가 공개됐다. Jira 커넥터를 사용하면 티켓 정보, 댓글, 사용자 프로필 데이터를 Lakehouse로 직접 수집할 수 있다. 데모에서는 Jira API 스코프를 설정하고 Databricks 카탈로그에서 연결을 생성하여 실시간으로 데이터를 가져오는 과정을 확인했다.
Databricks Assistant 및 에이전트 스킬 확장
Databricks Assistant가 공식 문서 페이지에 통합되어 사용자 질문에 즉각 답변하는 기능을 제공한다. 특히 '에이전트 스킬(Agent Skills)' 기능이 공개되어 사용자가 정의한 마크다운 파일이나 스크립트를 통해 어시스턴트의 기능을 확장할 수 있다. 이를 통해 특정 프로젝트의 코드 컨벤션이나 배포 스크립트 실행 순서와 같은 커스텀 지식을 어시스턴트에게 학습시켜 팀별 맞춤형 지원이 가능하다.
Spark Declarative Pipelines의 foreachBatch 지원
Spark Declarative Pipelines(SDP)에서 foreachBatch 기능을 지원함에 따라 복잡한 마이크로 배치 처리가 가능해졌다. 기존에는 스트리밍 파이프라인에서 커스텀 싱크를 구현하는 데 제약이 있었으나, 이제 JDBC를 통한 외부 DB 전송이나 복잡한 MERGE INTO 로직을 파이프라인 내부에 직접 작성할 수 있다. 이는 데이터 엔지니어가 선언적 파이프라인의 장점을 유지하면서도 세밀한 제어가 필요한 로직을 추가할 수 있게 한다.
python
def df_refund_road_update():
df = spark.read_table("caspersdev.recommender.refund_recommendations")
# ... (중략)
@dp.foreach_batch_sink(target="merge_into_sink")
def feb_batch_update(batch_df, batch_id):
batch_df.createOrReplaceTempView("batch_df_view")
df.sparkSession.sql("""
MERGE INTO caspersdev.recommender.df_refund_rcmd_update AS T
USING batch_df_view AS S
ON T.order_id = S.order_id
WHEN MATCHED THEN UPDATE SET T.agent_response = S.agent_response
""")Spark Declarative Pipelines(SDP)에서 foreachBatch를 사용하여 커스텀 MERGE 로직을 구현하는 예시
파운데이션 모델 API 및 Claude/GPT 통합
Databricks Foundation Model API를 통해 OpenAI의 GPT-4o와 Anthropic의 Claude 3.5 모델을 직접 호출할 수 있는 환경이 구축됐다. 인퍼런스 테이블(Inference Table) 설정을 활성화하면 모든 모델 호출 요청과 응답 데이터가 자동으로 로깅된다. 이를 통해 에이전트의 대화 이력을 분석하고, 자주 발생하는 패턴을 파악하여 새로운 '스킬'을 생성하거나 모델의 성능을 최적화하는 피드백 루프를 만들 수 있다.
Delta Sharing과 Iceberg 호환성 강화
Delta Sharing이 이제 Apache Iceberg 포맷을 지원하여 이기종 플랫폼 간의 데이터 공유가 더욱 용이해졌다. 기존 Delta 테이블의 메타데이터 설정을 변경하여 Iceberg 호환 모드를 활성화하면, 데이터를 물리적으로 복제하지 않고도 Iceberg 클라이언트를 사용하는 외부 조직과 실시간으로 데이터를 공유할 수 있다. 이는 데이터 사일로를 제거하고 멀티 클라우드 환경에서의 협업 효율성을 극대화한다.
Knowledge Assistant GA 및 Lakebase 자동 확장
RAG 시스템을 코딩 없이 구축할 수 있는 Knowledge Assistant가 정식 출시(GA)되었다. 사용자는 PDF나 워드 문서가 담긴 볼륨을 선택하기만 하면 즉시 답변 가능한 챗봇 에이전트를 생성할 수 있다. 또한 Postgres 기반의 Lakebase가 퍼블릭 프리뷰로 공개되어 컴퓨팅 자원의 자동 확장(Autoscaling)을 지원한다. Lakebase는 데이터와 애플리케이션 간의 지연 시간을 최소화하며, 사용하지 않을 때는 자원을 0으로 줄여 비용을 절감한다.
용어 해설
- 델타 셰어링(Delta Sharing)
- — 데이터를 복제하거나 이동하지 않고도 서로 다른 컴퓨팅 환경이나 조직 간에 실시간으로 데이터를 안전하게 공유할 수 있는 오픈 프로토콜이다. 중앙 집중식 거버넌스를 유지하면서도 다양한 쿼리 엔진에서 공유 데이터에 접근할 수 있게 해준다.
- 아파치 아이스버그(Apache Iceberg)
- — 거대한 분석 데이터셋을 위한 오픈 테이블 포맷으로, SQL 테이블과 같은 의미론을 제공하면서도 클라우드 스토리지에서 고성능 쿼리를 가능하게 한다. 스키마 진화, 파티션 레이아웃 변경, 타임 트래블 기능을 지원하는 것이 특징이다.
- 자바 데이터베이스 연결(JDBC)
- — 자바 프로그램이 데이터베이스와 연결되어 SQL 문을 실행할 수 있도록 해주는 표준 API이다. 다양한 관계형 데이터베이스(RDBMS)에 독립적인 인터페이스를 제공하여 데이터 수집 및 전송 파이프라인에서 널리 사용된다.
- 서버리스(Serverless)
- — 개발자가 서버 인프라를 직접 관리하지 않고 애플리케이션을 실행할 수 있는 클라우드 컴퓨팅 모델이다. 사용량에 따라 자원이 자동으로 확장되거나 축소되며, 실제 사용한 리소스에 대해서만 비용을 지불하는 경제성을 제공한다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 02.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.