본문으로 건너뛰기
Databricks Blog조회 1

Databricks와 MapAid: 멀티모달 AI를 활용한 수단 지하수 데이터 아카이브 디지털화

Databricks와 MapAid가 멀티모달 AI를 사용하여 수단의 방대한 스캔 지질 문서를 검색 가능한 데이터베이스로 변환하고 지하수 예측 모델을 강화했습니다.

섹션별 상세

수십 년간 축적된 수단의 지질 조사 보고서가 스캔 이미지 형태로만 존재하여 실제 구호 현장에서 활용하기 어려운 문제가 있었습니다. Databricks AI Functions를 활용해 스캔된 페이지 이미지를 멀티모달 모델에 직접 입력하여 시각적으로 내용을 이해하도록 설계했습니다. 이를 통해 5,570페이지의 문서를 3시간 만에 처리하여 검색 가능한 디지털 자산으로 전환했습니다. 비정형 데이터의 가시성을 확보함으로써 연구자들이 필요한 정보를 수 초 내에 찾을 수 있게 되었습니다.
데이터 준비부터 분류, 평가, 수자원 데이터 추출까지 이어지는 전체 문서 처리 파이프라인 다이어그램
Diagram스캔된 파일이 Unity Catalog를 거쳐 샘플링되고, 멀티모달 AI를 통해 분류 및 품질 평가가 이루어지는 흐름을 보여줍니다. 특히 수자원 관련 플래그가 있는 경우에만 OCR과 데이터 추출 단계로 넘어가는 조건부 로직을 시각화하여 파이프라인의 효율성을 설명합니다.
근거
  • 5,570페이지의 문서를 3시간 이내에 분류 완료했다. What This Means on the Ground 섹션의 수치 데이터
대규모 문서 처리 비용을 절감하기 위해 문서의 길이와 특성에 따른 지능형 샘플링 전략을 도입했습니다. 짧은 문서는 전체를 분석하고 긴 문서는 표지, 서론, 결론 등 핵심 정보가 포함된 섹션만 추출하여 분석함으로써 AI 처리량을 70% 이상 줄였습니다. 샘플링된 페이지는 듀이 십진분류 코드와 지리적 위치 정보를 포함한 구조화된 JSON으로 출력됩니다. 비용 효율성을 극대화하면서도 분류 품질을 유지하여 대규모 아카이브 처리에 최적화된 구조를 구현했습니다.
근거
  • 지능형 샘플링 전략을 통해 AI 처리량을 70% 이상 절감했다. Classifying Scanned Documents with Multimodal AI 섹션의 네 번째 문단
분류된 문서 중 수자원 관련성이 높은 페이지를 선별하여 OCR 및 개체명 인식(NER)을 수행하고 핵심 수치 데이터를 추출합니다. 멀티모달 모델은 영어와 아랍어, 복잡한 표, 수기 메모가 섞인 레이아웃에서 GPS 좌표, 시추 깊이, 펌프 테스트 결과 등을 식별합니다. 추출된 데이터는 여러 페이지에 걸쳐 분산된 정보를 하나의 우물 식별자를 기준으로 통합하여 구조화된 레코드로 생성됩니다. 이 데이터는 MapAid의 WellMapr 예측 모델에 직접 입력되어 지하수 위치 파악의 정확도를 높이는 데 사용됩니다.
AI가 생성한 결과의 신뢰성을 보장하기 위해 별도의 AI 모델을 판독관으로 사용하는 자동 품질 평가 단계를 파이프라인에 통합했습니다. 평가 모델은 분류 결과의 정확성, 완전성, 일관성을 기준으로 점수를 매기고 'Excellent'부터 'Poor'까지 등급과 근거를 기록합니다. 첫 실행 결과 95%의 분류가 우수 등급을 받았으며 신뢰도가 낮은 문서만 인간 전문가가 검토하도록 하여 효율성을 높였습니다. 이는 도메인 전문가의 리소스를 가장 필요한 곳에 집중시킬 수 있는 감사 가능한 추적 경로를 제공합니다.
근거
  • 자동 평가 모델에 의해 분류 결과의 95%가 'Excellent' 또는 'Good' 등급을 받았다. What This Means on the Ground 섹션의 통계

용어 해설

멀티모달 AI(Multimodal AI)
텍스트뿐만 아니라 이미지, 오디오 등 다양한 형태의 데이터를 동시에 이해하고 처리할 수 있는 AI 모델입니다. 이 프로젝트에서는 스캔된 문서 이미지를 텍스트 변환 없이 직접 시각적으로 분석하여 내용을 분류하고 정보를 추출하는 데 사용되었습니다.
듀이 십진분류법(Dewey Decimal Classification)
전 세계 도서관에서 널리 사용되는 표준 도서 분류 체계입니다. AI가 스캔된 지질 조사 보고서의 내용을 분석하여 이 표준 코드에 따라 자동으로 분류함으로써 방대한 아카이브를 체계적으로 구조화하는 기준이 됩니다.
광학 문자 인식(OCR)
이미지 속에 포함된 텍스트를 기계가 읽을 수 있는 디지털 데이터로 변환하는 기술입니다. 본 프로젝트에서는 수십 년 된 스캔 문서의 표, 필기체 메모, 아랍어 등이 섞인 복잡한 레이아웃에서 수문 지질학적 데이터를 추출하는 데 활용되었습니다.
서버리스 컴퓨팅(Serverless Compute)
사용자가 서버 인프라를 직접 관리하지 않고 코드 실행에 필요한 자원을 클라우드가 자동으로 할당하는 방식입니다. 데이터 처리 파이프라인이 실행될 때만 비용이 발생하므로 비영리 단체가 대규모 문서를 경제적으로 처리하기에 적합합니다.

기술

  • Databricks
  • Unity Catalog
  • Delta Lake
  • AI Functions
  • Lakeflow Jobs
  • Foundation Model API

활용 사례

  • 역사적 문서 아카이브의 자동 분류 및 검색 시스템
  • 스캔된 기술 보고서에서 구조화된 수치 데이터 추출
  • AI 기반 데이터 품질 평가 자동화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 12.수집 2026. 05. 12.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.