본문으로 건너뛰기
IBM Technology조회 2

RAG의 한계를 극복하는 Chunkless RAG와 문서 구조 보존 기술.

문서의 구조를 파괴하는 기존 RAG의 청킹 방식 대신, Docling으로 구조를 보존하고 에이전트가 트리를 탐색하여 정확도를 높이는 Chunkless RAG 기법.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기존 RAG는 문서를 임의의 청크로 분할하여 벡터화함으로써 문서 고유의 계층 구조와 맥락을 파괴하는 문제가 있다. Chunkless RAG는 Docling을 사용하여 문서의 트리 구조를 보존하고, AI 에이전트가 이 구조를 따라 탐색하게 함으로써 문서의 의미를 온전히 유지한다. 이 방식은 복잡한 문서에서 정확한 추론과 답변을 가능하게 하지만, 에이전트의 탐색 과정으로 인해 기존 방식보다 높은 지연 시간이 발생한다. 따라서 대규모의 단순 데이터에는 기존 RAG를, 구조적 이해가 필수적인 정밀한 문서에는 Chunkless RAG를 선택적으로 활용해야 한다.

챕터별 상세

00:00

기존 RAG의 한계와 청킹 문제

200페이지 분량의 보고서에서 특정 정보를 찾을 때 기존 RAG는 문서를 500단어 단위의 청크로 임의 분할한다. 이 과정에서 표, 제목, 단락 간의 계층 구조가 파괴되어 모델이 문서의 전체적인 맥락을 파악하지 못하게 된다. 단순 유사도 검색에 의존하는 방식은 복잡한 문서의 구조적 의미를 담아내지 못한다.

청킹은 긴 텍스트를 모델이 처리 가능한 크기로 나누는 필수 과정이지만, 구조적 정보를 손실시키는 주원인이기도 하다.

01:57

Chunkless RAG의 작동 원리

Chunkless RAG는 문서를 청크로 쪼개지 않고 원본의 트리 구조를 그대로 유지한다. 문서의 제목, 섹션, 단락, 표가 포함된 계층 구조를 보존한 상태에서 AI 에이전트가 이 트리를 따라 탐색한다. 모델은 단순 유사도 검색 대신 구조를 따라가며 질문에 필요한 섹션을 찾아내어 답변을 생성한다.

트리 구조를 유지하면 모델이 문서의 목차를 따라가듯 정보를 탐색할 수 있어 맥락 파악에 유리하다.

04:09

Docling을 활용한 문서 구조화

PDF와 같은 실제 문서는 단순 텍스트가 아닌 복잡한 레이아웃을 가진다. Docling은 이러한 문서를 파싱하여 제목, 표, 단락이 포함된 구조화된 객체로 변환한다. 이 도구가 생성한 구조화된 트리는 Chunkless RAG가 작동하기 위한 기반 데이터가 된다.

Docling은 비정형 문서인 PDF를 기계가 이해할 수 있는 정형화된 구조로 변환하는 역할을 한다.

05:17

Chunkless RAG의 이점과 트레이드오프

Chunkless RAG는 문서의 계층 구조를 보존하여 문맥 이해도를 높이고 여러 섹션에 걸친 추론을 가능하게 한다. 하지만 문서를 구조화하는 과정이 필요하고, 에이전트가 트리를 탐색하는 과정에서 모델과의 상호작용이 늘어나 지연 시간이 발생한다. 대규모의 단순 데이터에는 기존 RAG가, 구조가 중요하고 정밀한 답변이 필요한 문서에는 Chunkless RAG가 적합하다.

용어 해설

검색 증강 생성(RAG)
외부 문서를 검색하여 LLM의 답변에 필요한 맥락을 제공하는 기술. 기존 방식은 문서를 고정된 크기의 청크로 나누어 벡터화하고 유사도 검색을 수행한다.
청킹(Chunking)
긴 문서를 AI 모델이 처리할 수 있는 작은 단위로 나누는 과정. 문맥을 고려하지 않고 임의로 자를 경우 문서의 계층 구조와 의미가 파괴될 수 있다.
Docling
IBM에서 개발한 문서 파싱 도구. PDF 등 복잡한 문서를 분석하여 제목, 표, 단락 등 원본의 계층적 트리 구조를 보존한 형태로 변환한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 09.수집 2026. 08. 09.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.