본문으로 건너뛰기

기업용 RAG 정확도를 높이는 문맥 파이프라인

복잡한 기업 문서의 의미를 보존하는 파싱·청킹·검색 설계가 RAG 정확도를 약 46%에서 90% 이상으로 끌어올립니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기업용 RAG는 일반 텍스트 벤치마크에서 90%를 넘는 정확도를 기록해도 표, 차트, 다중 페이지 문서가 포함되면 약 46%까지 떨어질 수 있으며, 원인은 LLM보다 문맥 파이프라인 앞단에서 의미가 사라지는 데 있을 수 있습니다. 파싱 단계에서는 복잡한 시각 구조와 페이지 간 관계를 보존하고, 청킹 단계에서는 제목·표·다이어그램·절차를 의미 단위로 묶으며, 색인 단계에서는 요약·태그·질문 표현을 함께 저장해야 합니다. 검색 단계에서는 제품·지역·고객 등급 같은 조건을 메타데이터로 먼저 걸러내고, 여러 문서의 연결된 사실이 필요한 질문에는 Graph RAG를 적용합니다. 단계별로 하나의 변경만 평가한 결과 정확도는 65.1%에서 Intelligent Parsing 적용 후 84.4%, Enriched Indexing 적용 후 86.8%로 올랐고, 전체 개선을 합친 기업 문서 평가에서는 약 46%에서 90% 초과로 상승했습니다.

섹션별 상세

01
표의 병합 셀과 중첩 헤더가 여러 페이지에 걸쳐 있으면 파서가 두 번째 페이지를 별도 객체로 분리하는 순간 행과 헤더의 관계가 끊길 수 있습니다. 이후 청커가 남은 행을 고정 토큰 경계로 나누면 검색 결과에는 값만 남고 그 값이 어느 항목에 속하는지 알 수 없게 됩니다. 이런 손실은 LLM이 복원할 수 없으므로, 파이프라인은 단순 텍스트와 표·차트·다이어그램을 구분해 복잡도에 맞는 처리 경로로 보내야 합니다.
RAG 시스템이 데이터 연결, 문맥 데이터 준비, 검색, 답변 생성으로 이어지는 흐름을 나타낸 다이어그램입니다.
Diagram이미지는 파싱과 청킹을 거친 문서가 지식 그래프와 벡터 색인으로 변환되고, 검색 단계에서 Semantic Search·Graph Search·Metadata filtering을 선택한 뒤 LLM 답변으로 이어지는 구조를 담고 있습니다. 기사에서 강조한 문맥 보존, 검색 방식 선택, 답변 생성의 단계별 진단 흐름과 직접 연결됩니다.
02
RAG의 최종 오답만으로는 파싱, 청킹, 검색, 답변 생성 중 어디에서 문제가 생겼는지 알기 어렵습니다. 먼저 원문에서 응답까지의 경로를 그린 뒤, 답변에 필요한 문맥이 완전했는지 확인하고 문맥이 부족하면 올바른 문서와 청크가 검색됐는지, 그보다 앞서 정보가 제대로 파싱됐는지를 역순으로 추적해야 합니다. 이 방식은 검색 결과가 나쁜 이유가 유사도 순위의 실패인지, 아니면 앞단에서 정답 표가 이미 훼손됐기 때문인지 구분하게 해줍니다.
03
Intelligent Parsing은 페이지 단위로 콘텐츠 복잡도를 판별해 단순한 문장은 빠른 결정론적 경로로 보내고 시각적 관계가 필요한 페이지는 더 깊은 처리를 거치게 합니다. 다중 페이지 표를 하나의 논리적 단위로 유지해 헤더와 행의 관계를 보존하며, 초기 단계 평가에서 정확도를 65.1%에서 84.4%로 19.3 percentage points 높였습니다. 이 결과는 텍스트를 추출하는 것보다 문서 의미를 보존하는 파싱이 중요하다는 점을 드러냅니다.
04
고정 크기 청킹은 제조 매뉴얼의 절차를 제목, 경고, 인접 다이어그램과 분리해 문법적으로는 자연스럽지만 실행에는 쓸모없는 조각을 만들 수 있습니다. 제목을 표와 함께 두고 다이어그램을 설명 문장과 묶으며 절차의 순서를 유지하는 구조적 경계를 사용해야 하고, 분할이 필요하면 겹치는 청크로 경계의 연속성을 보완해야 합니다. 원문·요약·태그·구조 문맥·예상 질문을 함께 색인하고 SFR Embedding v3의 문맥 용량을 512 tokens에서 8,000 tokens로 확장한 구성은 단계별 평가에서 정확도를 84.4%에서 86.8%로 높였습니다.
05
의미적으로 가장 가까운 청크가 기업 업무상 올바른 근거라는 보장은 없습니다. 여러 제품의 유사한 장애 해결 문서가 함께 색인된 경우 제품, 지역, 고객 등급 같은 명시적 조건을 먼저 메타데이터로 필터링한 뒤 제한된 집합 안에서 의미 검색을 수행해야 합니다. 답이 여러 문서에 흩어져 있으면 사실과 문서의 연결 관계를 그래프로 구성한 Graph RAG가 관련 근거를 따라가며 다중 홉 질문을 처리하고, 원문은 이 기능의 일반 제공 시점을 2026년 11월로 제시합니다.
구조화·비구조화 데이터가 문맥 준비와 검색을 거쳐 문맥 기반 답변으로 변환되는 RAG 파이프라인 다이어그램입니다.
Diagram다이어그램은 입력 데이터가 Parsing과 Chunking을 거쳐 Knowledge Graph와 Vector Indexing으로 준비되고, 검색 단계에서 의미 검색·그래프 검색·메타데이터 필터링이 사용되는 과정을 보여줍니다. 이는 기사에서 각 파이프라인 단계가 서로 다른 실패 원인을 만들며 검색 질문의 구조에 따라 방법을 골라야 한다는 내용과 맞닿아 있습니다.
06
파서, 청킹, 임베딩 모델, 검색 방식을 한 번에 바꾸면 점수가 올라도 어느 변경이 효과를 냈는지 알 수 없습니다. 사람의 검증을 거친 최종 답변을 기준으로 사실 정확성, 올바른 문서의 최상위 인용 여부, 청크의 문맥 충분성을 확인한 뒤 한 단계씩 바꾸고 동일한 평가를 반복해야 합니다. 단계별 평가에서는 65.1%에서 84.4%, 86.8%로 추적 가능한 상승을 얻었고, 전체 개선을 적용한 복잡한 기업 문서 평가에서는 약 46%에서 90% 초과로 정확도가 높아졌습니다.
RAG 파이프라인의 데이터 연결, 문서 이해, 검색, 답변 생성을 한 흐름으로 묶은 전체 구조도입니다.
Diagram이미지는 RAG가 원천 데이터 연결에서 시작해 문서 구조와 표를 파싱하고, 의미 단위 청킹과 색인을 거쳐 검색 결과를 LLM에 공급하는 순서를 나타냅니다. 기사 결론인 ‘LLM이 최종 답변을 만들지만 무엇을 알 수 있는지는 문맥 파이프라인이 결정한다’는 관점을 시각적으로 보완합니다.
07
정확도뿐 아니라 인덱싱 지연도 기업용 RAG의 운영 품질을 좌우합니다. 기존 Spark 기반 구조는 대량 배치 인덱싱에 맞춰져 있었지만 100 MB보다 작은 업로드를 빠르게 조회해야 하는 요구에는 맞지 않아, 서비스 기반 Just-in-Time 인덱싱으로 전환한 뒤 인덱싱 시간이 3~4배 줄고 30분 이상 걸리던 대기가 약 7~10분으로 단축됐습니다. 따라서 동일한 벤치마크에서 주제와 콘텐츠 양식별 실패를 나누고 정확도와 지연을 함께 측정해야 파이프라인 개선의 실제 효과를 확인할 수 있습니다.

용어 해설

검색 증강 생성(RAG)
RAG는 외부 문서에서 관련 정보를 검색한 뒤 그 결과를 LLM의 입력 문맥에 넣어 답변을 생성하는 구조입니다. 문서 파싱, 청킹, 임베딩, 검색을 거치며 앞단에서 표의 헤더나 문서 간 관계가 사라지면 LLM이 높은 추론 능력을 갖춰도 잘못된 답변을 만들 수 있습니다. 따라서 최종 답변뿐 아니라 문맥이 만들어지고 선택되는 각 단계를 함께 평가해야 합니다.
의미 기반 청킹(Semantic Chunking)
의미 기반 청킹은 문서를 일정한 토큰 수로 자르는 대신 제목, 표, 다이어그램, 절차처럼 의미가 함께 유지되어야 하는 구조를 기준으로 나누는 방식입니다. 각 청크가 파일명이나 주변 문맥 없이도 독립적인 의미 단위가 되도록 만들며, 필요한 경우 겹치는 청크와 메타데이터를 추가해 경계에서 정보가 끊기는 문제를 줄입니다. RAG에서는 검색 결과의 문맥 충실도를 높이는 핵심 전처리 단계입니다.
벡터 임베딩(Vector Embedding)
벡터 임베딩은 텍스트나 문서 조각을 의미를 반영한 수치 벡터로 변환해 유사도 검색에 사용할 수 있게 하는 표현입니다. RAG 파이프라인에서는 원문 청크와 요약·태그·구조 문맥·예상 질문 같은 확장 표현을 함께 색인할 수 있습니다. 임베딩의 문맥 처리 길이가 늘어나면 여러 단계로 나뉘던 절차나 긴 문서 단위를 더 온전히 검색 대상으로 유지할 수 있습니다.
메타데이터 필터링(Metadata Filtering)
메타데이터 필터링은 의미 유사도 순위를 계산하기 전에 제품, 지역, 고객 등급처럼 질문에 포함된 명시적 조건으로 검색 대상을 제한하는 방식입니다. 먼저 조건을 만족하는 문서 집합을 만들고 그 안에서 의미 검색을 수행하므로, 다른 제품의 유사한 문서가 선택되는 오류를 줄일 수 있습니다. 기업용 RAG에서는 의미적 유사성과 결정적 업무 규칙을 결합하는 검색 제어 수단으로 쓰입니다.
그래프 RAG(Graph RAG)
Graph RAG는 사실, 레코드, 문서 사이의 관계를 지식 그래프로 만들고 연결된 근거를 따라가며 답변에 필요한 정보를 찾는 방식입니다. 하나의 청크에 답이 모두 담기지 않은 다중 홉 질문에서는 독립적인 벡터 유사도만으로 관계를 복원하기 어렵기 때문에 그래프 탐색이 활용됩니다. 원문은 Graph RAG의 일반 제공 시점을 2026년 11월로 제시합니다.

기술

  • RAG
  • LLM
  • Intelligent Parsing
  • SFR Embedding v3
  • Semantic Search
  • Graph RAG
  • metadata filters
  • Spark
  • Just-in-Time indexing
  • vector embeddings

활용 사례

  • 보험 약관의 보장 범위 질의응답
  • 금융 문서의 표와 수치 검색
  • 제조 매뉴얼의 절차 검색
  • 제품별 장애 해결 문서 검색
  • 여러 문서의 연결된 사실을 요구하는 다중 홉 질의
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 10.수집 2026. 09. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.