챕터별 상세
Graph-based RAG의 개요와 필요성
기존 바닐라 RAG는 텍스트를 단순 청크로 나누어 벡터 임베딩하므로 청크 간의 관계 정보를 소실하는 문제가 있다. Graph-based RAG는 텍스트 코퍼스를 엔티티와 관계 중심의 지식 그래프로 표현하여 데이터베이스를 구축한다. 이를 통해 복잡한 상호 관계를 포함한 질의나 전역적인 요약이 필요한 질의에서 훨씬 높은 정확도를 보인다. 의학 연구 분석이나 법률 판례 분석처럼 여러 문서에 흩어진 정보를 연결해야 하는 도메인에서 특히 유용하다.
바닐라 RAG는 코사인 유사도 기반의 단순 검색에 의존하지만, 그래프 기반은 노드 간의 연결성을 추적할 수 있다.
Graph-based RAG의 연구 흐름
Microsoft의 GraphRAG를 기점으로 지식 그래프를 활용한 RAG 연구가 본격화되었다. 초기 연구는 엔티티 추출 후 커뮤니티 탐지(Community Detection)를 통해 요약문을 생성하는 방식에 집중했다. 이후 검색 속도를 개선하거나 계층적 구조를 도입하여 정보의 중복을 줄이는 방향으로 발전했다. 최근에는 엔티티 노드뿐만 아니라 관계(Relationship) 자체를 키-값 쌍으로 재표현하여 검색 효율을 높이는 시도가 이어지고 있다.
LightRAG: 단순하고 빠른 그래프 RAG
LightRAG는 기존 GraphRAG의 높은 인덱싱 비용과 느린 검색 속도를 해결하기 위해 제안된 방법론이다. 엔티티와 관계를 각각 이름과 설명문의 키-값(K-V) 쌍으로 구조화하여 저장한다. 검색 시에는 질의에서 'Low-level' 키워드와 'High-level' 키워드를 동시에 추출하여 듀얼 레벨 검색을 수행한다. 실험 결과 기존 방식 대비 API 호출 횟수와 토큰 사용량을 획기적으로 줄이면서도 답변의 다양성 지표에서 우수한 성적을 거두었다.
듀얼 레벨 검색은 구체적인 엔티티 정보와 추상적인 주제 정보를 동시에 찾는 전략이다.
LeanRAG: 계층적 검색과 중복 제거
LeanRAG는 지식 그래프 내의 정보 중복을 최소화하고 계층적 구조를 활용하는 데 초점을 맞춘다. 엔티티들을 시맨틱 클러스터링하여 상위 개념의 'Abstract Entity'를 생성하고 이들 간의 관계를 다시 정의한다. 검색 시에는 LCA(Lowest Common Ancestor) 알고리즘을 사용하여 질의와 관련된 가장 적절한 계층의 서브그래프를 찾아낸다. 이를 통해 답변 생성에 불필요한 중복 정보를 걷어내고 핵심 맥락만을 LLM에 전달하여 효율성을 높인다.
LCA는 트리나 그래프 구조에서 두 노드의 공통된 가장 가까운 조상을 찾는 알고리즘이다.
실험 결과 및 결론
LightRAG와 LeanRAG 모두 기존 바닐라 RAG 및 초기 GraphRAG 모델보다 높은 성능을 기록했다. 특히 데이터셋의 크기가 커질수록 그래프 기반 방식의 성능 우위가 두드러지게 나타났다. LightRAG는 인덱싱 시간과 메모리 사용량 측면에서 압도적인 효율성을 보였다. LeanRAG는 정보의 중복을 줄임으로써 LLM이 더 정확한 맥락에서 답변을 생성하도록 돕는다는 점이 입증되었다.
text
-Entity: {entity_name}, {entity_type}, {description}
-Relationship: {src_tgt}, {description}, {strength}LLM을 통해 텍스트 코퍼스에서 엔티티와 관계를 추출하기 위한 표준 프롬프트 구조 예시
용어 해설
- 그래프 기반 검색 증강 생성(Graph-based RAG)
- — 지식 그래프(Knowledge Graph)로 표현된 데이터베이스를 활용하여 검색 증강 생성을 수행하는 방식이다. 텍스트 청크 간의 관계와 맥락을 보존할 수 있어 전체적인 내용 파악이 필요한 질의에 강점이 있다.
- 지식 그래프(Knowledge Graph)
- — 엔티티(노드)와 그들 사이의 관계(엣지)를 네트워크 형태로 표현한 지식 베이스이다. 비정형 텍스트에서 의미 있는 정보를 추출하여 구조화함으로써 복잡한 추론을 가능하게 한다.
- 계층적 검색(Hierarchical Retrieval)
- — 데이터를 여러 수준(예: 구체적 엔티티 수준부터 추상적 요약 수준까지)으로 계층화하여 검색하는 기법이다. 국소적인 정보와 전역적인 정보를 동시에 포착하여 답변의 품질을 높인다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 02.수집 2026. 05. 02.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.