TL;DR
로컬 분류기를 도입하여 단순 문서는 로컬에서 처리하고 복잡한 문서만 클라우드 파서로 라우팅함으로써 처리 비용을 대폭 절감한 사례.
배경
금융 및 보험 분야의 문서 처리 파이프라인을 구축하던 중, 모든 문서를 클라우드 파서로 처리하는 비용 문제를 해결하기 위해 로컬 분류기를 도입한 경험을 공유했다.
의미 / 영향
문서 처리 파이프라인에서 무분별한 클라우드 API 사용은 비용 낭비의 주원인이다. 로컬에서 처리 가능한 단순 문서와 클라우드 파서가 필요한 복잡한 문서를 구분하는 라우팅 로직만으로도 상당한 비용 절감이 가능하다.
섹션별 상세
import fitz # pymupdf
def classify_document(pdf_path):
doc = fitz.open(pdf_path)
total_chars = 0
garbled_chars = 0
table_signals = 0
for page in doc:
text = page.get_text()
total_chars += len(text)
garbled = sum( 1 for c in text if ord(c) > 127 and c not in '€£¥°©®™' )
garbled_chars += garbled
lines = text.split('
')
short_lines = [ l for l in lines if 2 < len(l) < 20 ]
if len(short_lines) / len(lines) > 0.4:
table_signals += 1
if total_chars == 0:
return 'cloud'
quality_ratio = 1 - (garbled_chars / total_chars)
table_density = table_signals / len(doc)
if quality_ratio > 0.95 and table_density < 0.2:
return 'local'
return 'cloud'문서의 텍스트 품질과 표 밀도를 분석하여 로컬 처리 여부를 결정하는 분류기 로직
용어 해설
- Document Parsing
- — 비정형 문서(PDF 등)에서 텍스트, 표, 레이아웃 정보를 추출하여 기계가 읽을 수 있는 데이터로 변환하는 과정. 금융 및 보험 분야에서 데이터 처리를 위해 필수적이다.
- Classifier
- — 입력 데이터를 특정 기준에 따라 범주로 나누는 모델이나 로직. 이 아티클에서는 문서의 복잡도를 판별하여 로컬 처리와 클라우드 파서 처리 중 적절한 경로를 선택하는 라우팅 도구로 사용된다.
언급된 도구
문서 텍스트 추출 및 분석
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.