본문으로 건너뛰기

Amazon Textract로 Bedrock 지식 기반 고도화

Amazon Textract 전처리와 Bedrock Knowledge Bases로 복잡한 utility bill RAG의 누락과 환각을 줄이는 배포 구성입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

복잡한 형식과 여러 페이지로 구성된 utility bill을 원문 그대로 RAG에 넣으면 due date, payment amount, account number 같은 핵심 정보가 빠지거나 잘못된 답변이 생성될 수 있습니다. 이 글은 Amazon Textract로 PDF, DOCX, TXT, HTML, XLSX, PNG 문서에서 텍스트와 표를 추출하고 정제한 뒤 Amazon Bedrock Knowledge Bases에 연결하는 custom knowledge base 구성을 제시합니다. S3 업로드를 Lambda가 감지하면 Textract 처리 결과를 TXT로 변환하고, OpenSearch Serverless와 Bedrock 지식 기반에서 검색할 수 있는 형태로 동기화합니다. AWS CloudFormation이 전체 리소스를 반복 가능하게 배포하며, Amazon Bedrock Guardrails와 grounding validation을 추가하면 운영 환경에서 유해 콘텐츠와 환각에 대한 통제를 강화할 수 있습니다.

섹션별 상세

01
여러 페이지 PDF와 복잡한 표를 포함한 utility bill을 직접 RAG에 넣으면 문서 형식과 레이아웃 차이 때문에 due date, payment amount, account number 같은 핵심 정보가 빠질 수 있습니다. LLM이 서로 다른 PDF, DOCX, TXT, HTML, XLSX 형식을 일관되게 처리하지 못하면서 질문과 무관한 내용을 답하거나 잘못된 정보를 생성하는 문제가 발생합니다. 따라서 원문 파일을 단순히 검색하는 대신 문서의 텍스트와 구조를 먼저 추출하고 정제하는 전처리 단계가 필요합니다.
02
Amazon Textract는 PDF, DOCX, TXT, HTML, XLSX, PNG에서 텍스트를 추출하고 표와 문서 구조를 처리하는 입력 계층을 맡습니다. 업로드된 원본 파일은 Amazon S3의 raw_files 폴더에 저장되고, document-parser Lambda가 업로드 이벤트를 받아 Textract 작업을 실행한 뒤 결과를 parsed_files에 기록합니다. 두 번째 Lambda는 처리 결과를 TXT 형식으로 변환해 parsed_kb_documents에 저장하므로 Amazon Bedrock Knowledge Bases가 검색할 수 있는 정제 문서가 만들어집니다.
03
배포 스크립트는 AWS CloudFormation 스택을 생성하고 Lambda 실행 역할과 레이어, 두 개의 Lambda 함수, S3 버킷, Amazon OpenSearch Serverless 클러스터, Amazon Bedrock Knowledge Bases, IAM 역할을 함께 구성합니다. 배포 뒤 S3에 raw_files 폴더를 만들고 utility bill을 올리면 문서 처리가 자동으로 시작되며, Bedrock 콘솔에서 데이터 소스를 동기화한 뒤 Amazon Nova Micro를 선택해 질의할 수 있습니다. 이 방식은 리소스 구성을 코드화해 여러 환경에서 같은 문서 처리 파이프라인을 반복 배포할 수 있게 합니다.
04
custom knowledge base는 추출된 utility bill 정보를 구조화된 형태로 태그해 LLM이 관련 필드와 표를 더 쉽게 찾도록 만듭니다. 제공된 비교 화면에서 전처리된 지식 기반은 2023년 8월 electricity usage를 고객명, 이전 검침값 3254, 현재 검침값 3478, 사용량 224 kWh와 연결해 답하고 due date도 문서 근거와 함께 반환합니다. 반대로 원문을 직접 사용한 구성은 여러 검색 청크를 확인하고도 해당 월의 electricity usage를 찾지 못했다고 답하므로, 문서 파싱과 태깅이 검색 정확도에 영향을 줍니다.
bash
bash custom_kb_deployment_setup.sh

AWS CloudFormation 스택과 솔루션의 의존 리소스를 배포하는 셸 스크립트를 실행합니다.

05
운영 환경에서는 검색된 원문과 답변의 연결을 검증하는 통제가 필요합니다. Amazon Bedrock Guardrails는 유해 콘텐츠와 차단 주제를 필터링하고 입력·출력의 민감 정보를 삭제할 수 있으며, grounding validation은 답변이 검색 문서에 근거하는지 평가해 환각을 줄입니다. 대규모 structured document를 처리하는 조직은 이 구성을 기반으로 문서 유형을 늘리거나 추가 AWS 서비스와 사용자 인터페이스를 결합할 수 있습니다.
Amazon Bedrock 테스트 화면에서 custom knowledge base가 utility bill 질의에 답하고 검색된 source chunk와 JSON 형태의 고객·청구·사용량 필드를 함께 표시합니다.
Screenshot첫 번째 화면은 2023년 8월 electricity usage를 224 kWh로 반환하면서 William Brown, 이전 검침값 3254, 현재 검침값 3478을 근거 데이터로 연결합니다. 오른쪽 source chunk에는 utility bill 문서에서 추출된 billing period, due date, usage details가 구조화되어 있어, 문서 파싱과 태깅이 LLM의 검색 결과에 제공하는 문맥을 구체적으로 보여줍니다.
원문 utility bill을 직접 사용한 Bedrock 테스트 화면에서 모델이 여러 source chunk를 확인했지만 2023년 8월 electricity usage를 찾지 못했다고 답합니다.
Screenshot두 번째 화면에서는 모델이 Utility Bill, Water Billing Statement, Recycling Service Invoice, Repair Invoice, Tax Preparation Receipt를 검색 결과로 확인하지만 질문에 필요한 electricity usage가 없다고 판단합니다. 첫 번째 화면의 구조화된 단일 source chunk와 달리 여러 청크가 펼쳐져 있어, 원문 문서 검색만으로는 관련 필드를 정확히 연결하기 어렵다는 비교 근거가 됩니다.

용어 해설

검색 증강 생성(RAG)
RAG는 질문과 관련된 외부 문서를 먼저 검색한 뒤 검색 결과를 언어 모델의 입력 문맥으로 넣어 답변을 생성하는 방식입니다. 원문 문서를 그대로 사용하면 검색 누락과 환각이 생길 수 있어 문서 전처리와 청킹 품질이 중요합니다.
문서 파싱(Document Parsing)
Document Parsing은 PDF, DOCX, HTML, XLSX 같은 파일에서 텍스트와 표, 이미지 등 구조화된 요소를 추출하는 과정입니다. 문서 형식과 레이아웃이 제각각인 환경에서는 이후 검색과 생성의 정확도를 좌우합니다.
Amazon OpenSearch Serverless
Amazon OpenSearch Serverless는 서버를 직접 관리하지 않고 검색 인프라를 운영하는 서비스입니다. 이 글의 배포 구성에서는 처리된 문서를 Amazon Bedrock Knowledge Bases가 검색할 수 있도록 지식 기반의 저장·검색 계층으로 사용됩니다.
AWS CloudFormation
AWS CloudFormation은 템플릿과 스택을 이용해 여러 AWS 리소스를 일관된 구성으로 생성하고 배포하는 서비스입니다. 이 글에서는 Lambda, S3, OpenSearch Serverless, Bedrock 지식 기반을 셸 스크립트로 함께 프로비저닝하는 데 쓰입니다.
근거 기반 검증(Grounding Validation)
Grounding Validation은 생성된 답변이 검색된 원본 문서에 근거하는지 평가해 환각을 줄이는 운영 통제입니다. 이 글에서는 RAG 시스템의 정확성과 신뢰성을 유지하기 위해 Amazon Bedrock Guardrails와 함께 활성화할 것을 권장합니다.

기술

  • Amazon Bedrock
  • Amazon Textract
  • Amazon Bedrock Knowledge Bases
  • Amazon Bedrock Guardrails
  • AWS CloudFormation
  • AWS Lambda
  • Amazon S3
  • Amazon OpenSearch Serverless
  • Amazon Nova Micro
  • GitHub

활용 사례

  • utility bill의 billing, usage, payment 질의 응답
  • 고객 서비스 팀의 다중 형식 문서 검색
  • 대규모 PDF와 이미지 문서의 자동 파싱
  • 구조화된 문서에서 account number와 payment instruction 추출
  • RAG 기반 지식 기반 구축과 운영
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 05.수집 2026. 09. 05.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.