본문으로 건너뛰기
r/LangChain조회 3

브라질 부동산 회사의 10,000개 부실 자산 정리를 위한 RAG 및 데이터 파이프라인 구축 계획

브라질의 한 부동산 회사가 수십 년간 방치된 10,000개의 토지 권리증과 500건의 소송 데이터를 정리하기 위해 OCR, Supabase, pgvector 기반의 RAG 시스템을 구축하는 기술 로드맵을 공유했다.

실용적 조언

  • 데이터의 형태를 모르는 초기 단계에서는 인프라 구축보다 Gemini 1.5 Pro와 같은 대규모 컨텍스트 모델을 사용한 데이터 탐색(Discovery)을 먼저 수행할 것
  • 비개발자 팀원이 데이터베이스를 직접 관리해야 하는 경우 Supabase 위에 NocoDB를 얹어 스프레드시트 UI를 제공할 것
  • 구조화된 데이터(필지 상태, 소송 번호)와 비구조화된 데이터(계약서 문구)가 섞여 있을 때는 벡터 검색 단독보다 SQL 쿼리를 병행하는 하이브리드 RAG를 설계할 것

섹션별 상세

01
OCR 및 데이터 추출 전략으로 수십 년 된 브라질 등기 서류의 가독성 문제를 해결하기 위해 Google Document AI, Mistral OCR, AWS Textract 등을 검토했다. 물리적 문서를 지자체별로 스캔하고 특정 명명 규칙에 따라 관리하며, 이를 OCR로 처리하여 텍스트화하는 공정을 첫 단계로 설정했다. 노후화된 라틴 아메리카 문서에 최적화된 도구 선택이 프로젝트의 성패를 가를 핵심 요소로 꼽혔다.
02
대규모 컨텍스트 윈도우를 활용한 초기 탐색 단계에서는 정식 데이터베이스 구축 전 Gemini나 Claude Projects를 사용하여 OCR 결과물을 직접 분석하는 방식을 채택했다. 이는 대량의 텍스트에서 중복 구매자, 부적절한 날짜, 수상한 활동 클러스터 등을 사전에 식별하여 데이터의 대략적인 형태를 파악하기 위함이다. 인프라 구축 전 데이터의 특성을 먼저 이해함으로써 시행착오를 줄이려는 전략적 접근이다.
03
데이터 표준화 및 엔티티 해상도 과정에서 10,000개의 레코드에 존재하는 지자체명 오기, 개인 식별 번호(CPF) 형식 불일치, 구매자 이름 변동 등을 해결하기 위해 Python의 rapidfuzz와 Claude API를 활용한 정규화를 계획했다. 단순 퍼지 매칭과 LLM 기반 정규화만으로 충분할지, 아니면 Dedupe.io와 같은 전문 엔티티 해상도 라이브러리가 필요한지에 대한 기술적 검토가 이루어졌다. 데이터의 무결성이 이후 RAG 성능과 직결되기 때문에 매우 중요한 단계이다.
04
Supabase와 pgvector 기반의 하이브리드 RAG 아키텍처를 통해 정형 데이터 쿼리를 위한 PostgreSQL과 비정형 문서 검색을 위한 pgvector를 결합한 2계층 검색 구조를 설계했다. Supabase를 백엔드로 사용하고 그 위에 NocoDB를 얹어 비개발자인 변호사들이 스프레드시트처럼 데이터를 관리할 수 있게 했다. 단순 벡터 검색만으로는 구조적 질문에 답하기 어렵기 때문에 결정론적 쿼리와 시맨틱 검색을 병행하는 방식을 선택했다.

용어 해설

검색 증강 생성(RAG)
외부 지식 베이스에서 관련 정보를 검색하여 대규모 언어 모델(LLM)의 답변 생성에 활용하는 기술이다. 이 프로젝트에서는 수만 장의 부동산 계약서에서 특정 필지에 대한 정보를 정확히 찾아내어 답변의 신뢰성을 높이는 데 사용된다.
PostgreSQL 벡터 확장(pgvector)
PostgreSQL 데이터베이스에서 벡터 데이터를 저장하고 유사도 검색을 수행할 수 있게 해주는 확장 모듈이다. 비정형 문서의 임베딩 값을 저장하여 시맨틱 검색을 가능하게 하며, 기존 관계형 데이터와 통합 관리가 용이하다.
엔티티 해상도(Entity Resolution)
서로 다른 데이터 소스나 텍스트에서 동일한 실체(사람, 장소, 사물 등)를 식별하고 통합하는 과정이다. 오타나 표기 방식이 제각각인 구매자 이름이나 지자체명을 하나의 표준 데이터로 정제하는 데 필수적이다.
광학 문자 인식(OCR)
이미지나 스캔된 문서 내의 텍스트를 기계가 읽을 수 있는 디지털 데이터로 변환하는 기술이다. 수십 년간 종이로 보관된 부동산 등기 서류를 디지털 파이프라인에 입력하기 위한 첫 번째 단계로 활용된다.
퍼지 매칭(Fuzzy Matching)
문자열이 정확히 일치하지 않더라도 유사도를 계산하여 근접한 항목을 찾아내는 기법이다. 데이터 정제 시 'Bela Vista'와 'B. Vista'처럼 사소한 차이가 있는 지명을 동일한 장소로 연결하는 데 사용된다.

언급된 도구

Supabase추천

PostgreSQL 기반 백엔드 및 pgvector를 활용한 벡터 데이터베이스

NocoDB추천

데이터베이스 위에 얹어 사용하는 스프레드시트 방식의 시각적 인터페이스

Claude추천

데이터 정규화 및 RAG 시스템의 최종 답변 생성 엔진

Gemini추천

대규모 컨텍스트 윈도우를 활용한 초기 데이터 탐색 및 분석

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 06.수집 2026. 04. 06.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.