TL;DR
LlamaIndex의 Retrieval Harness는 시맨틱 검색, 서버 사이드 grep, 파일 수준 내비게이션을 단일 에이전트 추론 루프에 통합하여 복잡한 문서 검색 성능을 극대화한다. 기존 RAG 시스템이 단순 벡터 유사도에 의존해 정밀한 키워드나 문서 구조 파악에 한계를 보였던 점을 개선하기 위해, 에이전트가 상황에 맞는 검색 도구를 능동적으로 선택하도록 설계되었다. LlamaParse의 고성능 파싱 능력을 기반으로 표와 레이아웃이 보존된 데이터를 활용하며, 이는 대규모 비정형 데이터셋에서 정보 추출의 정확도를 획기적으로 높이는 결과로 이어진다. 최종적으로 사용자는 복잡한 질의에 대해 에이전트가 스스로 판단하고 검증하는 고도화된 검색 경험을 구현할 수 있다.
챕터별 상세
RAG의 진화와 Retrieval Harness 도입 배경
RAG(검색 증강 생성)의 기본 개념과 벡터 검색의 한계를 이해하고 있어야 이 챕터의 필요성을 공감할 수 있다.
LlamaParse를 활용한 고성능 문서 파싱
LlamaParse는 LlamaIndex에서 제공하는 유료/무료 파싱 서비스로, 일반적인 PDF 라이브러리보다 레이아웃 보존 능력이 뛰어나다.
from llama_parse import LlamaParse
from llama_index.core import VectorStoreIndex
parser = LlamaParse(result_type="markdown")
documents = parser.load_data("./complex_document.pdf")
index = VectorStoreIndex.from_documents(documents)
query_engine = index.as_query_engine()LlamaParse를 사용하여 PDF를 마크다운으로 파싱하고 벡터 인덱스를 생성하는 기본 설정
Retrieval Harness의 핵심 구성 요소
시맨틱 검색(Semantic Search) 깊이 읽기
벡터 임베딩과 코사인 유사도에 대한 기초 지식이 필요하다.
서버 사이드 Grep의 정밀도와 활용
Grep은 유닉스 계열 시스템에서 텍스트를 검색할 때 사용하는 명령어로, 여기서는 이를 클라우드 엔진화한 기능을 의미한다.
파일 수준 내비게이션 및 구조 파악
from llama_index.core.agent import ReActAgent
from llama_index.core.tools import QueryEngineTool
tools = [
QueryEngineTool.from_defaults(
query_engine=retrieval_harness,
name="retrieval_harness",
description="Search and navigate through files"
)
]
agent = ReActAgent.from_tools(tools, verbose=True)Retrieval Harness를 도구로 사용하는 ReAct 에이전트 구성 예시
에이전트 추론 루프(Reasoning Loop) 설계
ReAct는 LLM이 추론과 행동을 결합하여 문제를 해결하는 대표적인 에이전트 프레임워크다.
실전 코드 워크스루: 시스템 구축하기
성능 최적화 및 벤치마크 결과
Naive RAG는 단순히 검색-생성 단계만 거치는 가장 기본적인 RAG 구조를 말한다.
결론 및 향후 로드맵
용어 해설
- Semantic Search
- — 단순한 키워드 매칭을 넘어 단어의 의미와 맥락을 이해하여 관련 정보를 찾는 기술이다. 문장을 벡터로 변환하여 수학적 유사도를 계산함으로써 '자동차' 검색 시 '차량'이나 '운송수단'이 포함된 결과도 찾아낼 수 있어 RAG 시스템의 핵심 요소로 활용된다.
- Agentic RAG
- — 단순히 문서를 검색하고 답변하는 정적 프로세스를 넘어 AI 에이전트가 스스로 어떤 도구를 사용할지, 검색 결과가 충분한지 판단하며 추론 루프를 수행하는 방식이다. 복잡한 질문에 대해 여러 단계의 검색과 검증 과정을 거쳐 답변의 정확도를 높인다.
- Server-side Grep
- — 클라이언트가 아닌 서버 엔진 수준에서 특정 텍스트 패턴이나 키워드를 직접 검색하는 기술이다. 대규모 문서 집합에서 임베딩 기반 검색이 놓칠 수 있는 고유 명사나 특정 수치를 정확하게 필터링하여 검색의 정밀도를 보완한다.
- Reasoning Loop
- — AI 모델이 문제를 해결하기 위해 '생각-행동-관찰'의 과정을 반복하는 메커니즘이다. Retrieval Harness 환경에서는 에이전트가 검색 결과를 분석하고 추가 정보가 필요한지 판단하여 다음 검색 쿼리를 생성하는 순환 구조를 의미한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



