본문으로 건너뛰기

Amazon Bedrock으로 계약 검색 정확도 높이기

AIDA가 메타데이터 필터링으로 계약 RAG의 정확도를 높인다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

복잡한 법률 계약은 조항의 문장만으로는 계약 유형, 준거법, 만료일을 판단하기 어려워 단순한 의미 검색 기반 RAG에서 중요한 맥락이 빠질 수 있습니다. AIDA는 Amazon Bedrock Knowledge Bases에서 문서를 메타데이터와 함께 청크로 나누고, 검색 전에 implicit filtering과 explicit filtering으로 후보 범위를 좁힌 뒤 문서 수준 메타데이터를 검색 청크에 보강합니다. CUAD 평가에서 top-k 15 기준 Baseline RAG의 coverage는 27.3%였지만 filtering과 enrichment를 함께 적용한 구성은 coverage 75.0%로 Snap/United만 만료 계약으로 식별하고 갱신 조건을 명확히 설명했습니다. Amazon Bedrock Guardrails와 IAM 정책, Retrieve API의 source attribution은 prompt injection과 민감정보 노출을 줄이고 답변의 접근 권한과 근거 추적성을 보완하지만, 최종 계약 해석은 법률 전문가의 검토가 필요합니다.

섹션별 상세

01
AIDA는 수천 건의 복잡한 계약에서 자연어 질문으로 권리, 갱신 조건, 관할권, 준수 의무를 찾는 업무를 지원하지만 단순한 의미 검색만으로는 충분하지 않습니다. 법률 문서는 조항 자체뿐 아니라 계약 유형, 준거법, 당사자, 만료일 같은 문서 수준 맥락에 의존하며, 검색 결과가 너무 많으면 LLM이 처리할 수 있는 범위를 넘어 중요한 조항이 누락될 수 있습니다. Amazon Bedrock Knowledge Bases 기반 RAG 파이프라인은 메타데이터와 접근 제어를 검색 과정에 결합해 사용자가 권한을 가진 계약 안에서 더 정확하고 추적 가능한 답변을 얻도록 구성됩니다.
02
계약은 구조화된 메타데이터 파일과 함께 Amazon Bedrock Knowledge Bases에 수집되고, 의미적으로 적절한 청크로 분할된 뒤 임베딩으로 변환되어 Amazon OpenSearch Service 또는 Amazon S3 Vectors에 저장됩니다. 각 문서에는 parties, effective date, termination date, jurisdiction 같은 속성이 연결되며, 저장 데이터는 암호화하고 AWS IAM 정책과 Amazon CloudWatch 로깅으로 접근 권한과 감사 추적을 관리합니다. 이 수집 구조가 이후의 메타데이터 필터링과 의미 검색에 필요한 기반이 됩니다.
Amazon Bedrock Knowledge Bases를 기반으로 계약 문서를 동기화하고 메타데이터를 설정한 뒤, 임베딩·필터링·문서 검색·프롬프트 보강·LLM 응답 생성을 거쳐 사용자에게 결과를 반환하는 9단계 RAG 흐름도입니다.
Diagram이미지는 AIDA의 데이터 수집 흐름과 사용자 질의 흐름을 하나의 아키텍처로 연결합니다. 문서는 Amazon Bedrock Knowledge Bases로 동기화되고 메타데이터 파일과 함께 처리되며, 질의는 query와 filter로 Retrieve API에 전달된 뒤 임베딩 생성, implicit/explicit filtering, 문서 검색, 검색 결과를 반영한 질의 보강, LLM 응답 생성 단계를 거쳐 응답으로 돌아옵니다. 각 단계가 1부터 9까지 표시되어 메타데이터 필터링과 검색 결과 보강이 단순 벡터 검색과 응답 생성 사이에 배치된다는 점을 보여줍니다.
03
사용자 질문은 Amazon Bedrock의 embedding models를 통해 임베딩으로 바뀌고, 검색 전에 implicit filtering과 explicit filtering을 거칩니다. 암시적 필터링은 계약 속성에서 조건을 자동으로 적용해 검색 공간을 먼저 줄인 다음, 남은 문서 집합에서 의미 유사도가 높은 청크를 찾으며, 명시적 필터링은 지역·기간·기밀성 등급 같은 조직 정책을 애플리케이션 계층에서 강제합니다. 이렇게 얻은 청크와 메타데이터를 원래 질문에 결합해 LLM에 전달하므로, 단어가 비슷하지만 다른 주의 계약이나 다른 관할권의 계약이 결과를 오염시키는 문제를 줄입니다.
04
검색된 청크만 LLM에 전달하면 조항이 licensing agreement에 속하는지, California law의 적용을 받는지, 실제로 만료됐는지 판단하기 어려울 수 있습니다. AIDA는 문서별로 청크를 묶고 governing law, expiration date, contract type 같은 메타데이터를 한 번 첨부해 입력 토큰을 불필요하게 반복하지 않으면서 조항과 계약 전체의 관계를 보강합니다. 예시 조항인 “This Agreement shall automatically renew for successive one-year terms unless either party provides written notice of non-renewal at least 60 days prior to the expiration date.”도 문서 메타데이터와 함께 제공될 때 만료 여부와 갱신 조건을 더 정확히 연결할 수 있습니다.
05
CUAD의 licensing 및 co-branding agreements를 사용한 평가에서 top-k는 15로 고정됐고, 필터와 메타데이터 보강을 함께 적용한 구성이 가장 신뢰할 만한 결과를 냈습니다. Baseline RAG는 후보 조항 55개 중 15개만 전달해 coverage 27.3%를 기록했고 Snap/United 계약을 만료 계약으로 찾았지만 갱신 정보가 불완전했습니다. implicit·explicit filtering과 메타데이터 enrichment를 함께 적용한 구성은 후보 집합 20개와 coverage 75.0%를 유지하면서 Snap/United만 만료 계약으로 식별하고 다른 계약의 갱신 조건을 명확히 설명했습니다.
06
Amazon Bedrock Guardrails는 질의 단계에서 prompt injection과 데이터 유출을 막고, 응답 단계에서 콘텐츠 필터링과 PII 보호, prompt safety controls를 적용합니다. Retrieve API는 생성된 답변을 원본 계약에 연결해 사용자가 근거 문서를 추적할 수 있게 하며, AWS IAM의 project scoped roles는 사용자별로 접근 가능한 계약과 수행 가능한 작업을 제한합니다. 다만 AI가 생성한 계약 해석은 사업 의사결정 전에 자격을 갖춘 법률 전문가가 검토해야 하며, AIDA의 역할은 법률 전문성을 대체하는 것이 아니라 보조하는 데 있습니다.
json
{ "andAll": [ { "listContains": { "key": "region", "value": "Germany" } }, { "stringEquals": { "key": "confidentiality_level", "value": "Public" } } ] }

지역이 Germany이고 기밀성 등급이 Public인 문서만 검색하도록 애플리케이션 수준의 명시적 필터를 구성합니다.

용어 해설

암시적 필터링(Implicit Filtering)
검색어마다 필터 표현식을 직접 작성하지 않아도 문서 메타데이터를 기준으로 검색 대상을 먼저 좁히는 Amazon Bedrock Knowledge Bases 기능입니다. 날짜, 계약 당사자, 문서 유형 같은 조건으로 벡터 검색 전에 후보 문서를 줄여 관련 없는 조항이 상위 결과를 차지하는 문제를 완화합니다.
명시적 필터링(Explicit Filtering)
애플리케이션 계층에서 미리 정한 조건을 모든 검색에 일관되게 적용하는 방식입니다. 지역, 기간, 기밀성 등급과 같은 정책을 사용자 입력이나 검색 엔진의 해석에 맡기지 않고 검색 결과에 강제해 규정 준수와 접근 경계를 유지합니다.
메타데이터 보강 청킹(Metadata-Enriched Chunking)
문서 조각을 검색 가능한 단위로 나눈 뒤 계약 유형, 준거법, 만료일, 당사자 같은 문서 수준 메타데이터를 함께 활용하는 처리 방식입니다. 여러 조각에 같은 메타데이터를 반복해 토큰을 낭비하지 않고 문서별로 묶어 한 번 첨부함으로써 LLM이 조항과 계약 맥락을 함께 판단하게 합니다.
후보 청크(Candidate Chunk)
사용자 질문과 의미적으로 연관될 가능성이 있어 검색 과정에서 고려되는 문서 조각입니다. Amazon Bedrock의 의미 검색은 최대 top k 100개의 후보 청크를 반환하지만, 상위 결과에 포함되지 않은 조각에 중요한 법적 맥락이 남을 수 있어 메타데이터 필터링이 필요합니다.
코사인 유사도(Cosine Similarity)
질의 임베딩과 문서 청크 임베딩 사이의 방향 유사성을 계산해 의미적으로 가까운 항목을 찾는 검색 기준입니다. 이 글의 구조에서는 메타데이터로 후보 문서 집합을 먼저 제한한 뒤 그 안에서 코사인 유사도가 높은 계약 조각을 선택합니다.

기술

  • AWS
  • Amazon Bedrock Knowledge Bases
  • Amazon Bedrock Guardrails
  • Amazon OpenSearch Service
  • Amazon S3 Vectors
  • Amazon Simple Storage Service (Amazon S3)
  • AWS Identity and Access Management (IAM)
  • Amazon CloudWatch
  • Retrieve API
  • embedding models
  • LLM
  • HTTPS/TLS 1.2+

활용 사례

  • 대규모 법률 계약 검색
  • 만료된 licensing agreements 식별
  • 관할권별 계약 검색
  • 계약 갱신 조항 분석
  • 기밀성 등급과 지역에 따른 문서 접근 제한
  • 감사 추적이 필요한 기업용 계약 인텔리전스
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.