TL;DR
플랫 마크다운 기반 RAG는 체인 실패 지점 추적이 불가능해 수렴이 느리고 한계가 있다고 원문은 진단했다. 이를 해결하기 위해 관찰 가능한 상태를 노드로, 행동을 엣지로 하는 부분 관찰 MDP 그래프를 구성하고 엣지에 성공확률·토큰비용·결과를 가중치로 부여해 탐험으로 그래프를 완성한 뒤 수집된 가중치로 exploit 정책을 적용했다고 보고됐다. 동일 작업을 Claude Opus 4.8과 Codex GPT-5.5에서 플랫 파일·GraphRAG·이 방식으로 비교한 결과 성공률이 약 0.78에서 약 0.95로 상승했고 토큰비용이 플랫 파일보다 낮았음이 확인됐다.
주요 논점
부분 관찰 MDP로 구성하면 각 행동 엣지에 성공확률과 토큰비용을 명시적으로 부여해 어느 단계가 취약한지를 파악할 수 있고, 탐험을 통해 그래프를 완성한 뒤 얻은 통계로 효율적인 정책을 적용할 수 있다고 보고됐다. 이 접근은 플랫 컨텍스트 방식 대비 성공률과 비용 측면에서 개선을 보였음이 실험에서 확인됐다. 따라서 구조화된 그래프 기반 모델이 체인 실패 문제와 비용 최적화에 실용적이라는 근거가 제시됐다.
실용적 조언
- 에이전트를 부분 관찰 MDP로 모델링하려면 우선 관찰 가능한 각 상태를 그래프의 노드로 정의하고 가능한 행동을 노드 간 엣지로 매핑해야 한다고 원문은 기술했다. 각 엣지에는 성공확률, 소모되는 토큰 비용, 그리고 발생 가능한 결과를 가중치로 기록해 탐색 단계에서 통계를 수집하는 방식이 구현 방식으로 제시됐다. 수집된 통계 기반 가중치를 사용해 이후에는 탐험을 최소화하고 수치적으로 유리한 엣지를 우선 선택하는 exploit 정책을 적용해야 한다고 제안됐다.
- 실험 설계는 동일한 작업 배치를 여러 처리 방식으로 반복 실행하는 것이며 원문은 플랫 파일·GraphRAG·POMDP 방식으로 비교 실험을 수행했다고 보고했다. 실험 결과는 성공률과 토큰비용을 명확한 지표로 삼아 비교해야 한다고 명시돼 있다. 따라서 재현을 위해서는 동일 입력 세트, 동일 모델 버전, 동일 비용 계측 방식을 일관되게 유지해야 한다고 서술됐다.
섹션별 상세
용어 해설
- GraphRAG
- — GraphRAG는 문서 기반 RAG 구성에서 문맥을 연결하여 'brain'처럼 관리하는 방식으로 이해된다. 플랫 파일이나 단일 마크다운에서 문맥을 직접 주입하는 전통적 RAG와 달리 노드·엣지 형태로 지식 조각을 구조화하면 탐색이 용이해진다. 원문에는 GraphRAG를 'brain'이라 칭하며 비교 대상으로 사용한 것이 확인됐다.
- 부분 관찰 MDP(partially observable MDP)
- — 부분 관찰 MDP는 에이전트가 완전한 환경 상태를 관찰하지 못할 때 상태 확률분포를 기반으로 의사결정을 수행하는 수학적 모델이다. 원문에서 이 구조는 관찰 가능한 상태를 노드로, 행동을 엣지로 매핑하고 엣지에 성공확률·토큰비용·결과를 가중치로 부여하는 방식으로 구현됐음이 확인됐다. 그러므로 에이전트는 그래프를 탐색해 성능 데이터를 수집하고 그 데이터를 바탕으로 탐험 후 활용(exploit)을 수행했다고 기술됐다.
- Claude Opus 4.8
- — Claude Opus 4.8은 원문에서 실험에 사용된 LLM 중 하나로 명시됐다. 실험에서는 동일 작업 배치를 Claude Opus 4.8과 Codex GPT-5.5에 적용해 비교한 것으로 나타났다. 따라서 성능 수치 비교는 이 모델들을 포함한 환경에서 도출된 결과임이 확인됐다.
언급된 도구
언어 모델로 실험에서 플랫 파일·GraphRAG·POMDP 기반 정책을 평가하는 데 사용된 모델이다.
언어 모델로 Claude Opus 4.8과 동일한 작업 배치에서 비교 실험을 수행하는 데 사용된 모델이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
