본문으로 건너뛰기

CLAUDE.md를 POMDP식 상태-행동 그래프로 교체해 성공률 16~20점 향상

플랫 마크다운 기반 RAG에서 체인 실패 원인 추적이 어려워 부분 관찰 MDP로 그래프화해 성공률을 0.78에서 0.95로 끌어올리고 토큰비용을 낮췄다고 보고됐다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

플랫 마크다운 기반 RAG는 체인 실패 지점 추적이 불가능해 수렴이 느리고 한계가 있다고 원문은 진단했다. 이를 해결하기 위해 관찰 가능한 상태를 노드로, 행동을 엣지로 하는 부분 관찰 MDP 그래프를 구성하고 엣지에 성공확률·토큰비용·결과를 가중치로 부여해 탐험으로 그래프를 완성한 뒤 수집된 가중치로 exploit 정책을 적용했다고 보고됐다. 동일 작업을 Claude Opus 4.8과 Codex GPT-5.5에서 플랫 파일·GraphRAG·이 방식으로 비교한 결과 성공률이 약 0.78에서 약 0.95로 상승했고 토큰비용이 플랫 파일보다 낮았음이 확인됐다.

주요 논점

01찬성다수

부분 관찰 MDP로 구성하면 각 행동 엣지에 성공확률과 토큰비용을 명시적으로 부여해 어느 단계가 취약한지를 파악할 수 있고, 탐험을 통해 그래프를 완성한 뒤 얻은 통계로 효율적인 정책을 적용할 수 있다고 보고됐다. 이 접근은 플랫 컨텍스트 방식 대비 성공률과 비용 측면에서 개선을 보였음이 실험에서 확인됐다. 따라서 구조화된 그래프 기반 모델이 체인 실패 문제와 비용 최적화에 실용적이라는 근거가 제시됐다.

실용적 조언

  • 에이전트를 부분 관찰 MDP로 모델링하려면 우선 관찰 가능한 각 상태를 그래프의 노드로 정의하고 가능한 행동을 노드 간 엣지로 매핑해야 한다고 원문은 기술했다. 각 엣지에는 성공확률, 소모되는 토큰 비용, 그리고 발생 가능한 결과를 가중치로 기록해 탐색 단계에서 통계를 수집하는 방식이 구현 방식으로 제시됐다. 수집된 통계 기반 가중치를 사용해 이후에는 탐험을 최소화하고 수치적으로 유리한 엣지를 우선 선택하는 exploit 정책을 적용해야 한다고 제안됐다.
  • 실험 설계는 동일한 작업 배치를 여러 처리 방식으로 반복 실행하는 것이며 원문은 플랫 파일·GraphRAG·POMDP 방식으로 비교 실험을 수행했다고 보고했다. 실험 결과는 성공률과 토큰비용을 명확한 지표로 삼아 비교해야 한다고 명시돼 있다. 따라서 재현을 위해서는 동일 입력 세트, 동일 모델 버전, 동일 비용 계측 방식을 일관되게 유지해야 한다고 서술됐다.

섹션별 상세

플랫 마크다운 또는 GraphRAG 'brain' 방식은 에이전트가 체인의 어느 단계에서 실패했는지 명확히 지목할 수 없어서 설명가능성이 낮고 수렴 속도가 느리며 상한이 존재한다고 진단했다. 원문은 이 문제를 해결하기 위해 환경을 부분 관찰 MDP로 재구성했다고 기술했다. 이 재구성은 디버깅 가능성과 정책 개선의 관점에서 구조적 이점을 제공했다고 보고됐다.
구체적 구현은 관찰 가능한 상태를 그래프의 노드로, 가능한 행동을 노드 간 엣지로 변환하고 각 엣지에 성공확률, 토큰 비용, 결과를 가중치로 부여하는 방식으로 이루어졌다고 밝혔다. 에이전트는 먼저 그래프를 탐색하여 각 엣지의 통계·비용·결과를 수집하고 이후 수집된 가중치를 사용해 표준 RL처럼 exploit 단계에서 정책을 적용했다고 설명됐다. 따라서 학습 과정은 탐험(데이터 수집)→모델링(가중치 부여)→활용(정책 적용)의 순서로 진행된 것이 확인됐다.
동일 작업 배치를 플랫 파일, GraphRAG 'brain', 이 POMDP 기반 그래프 방식으로 Claude Opus 4.8과 Codex GPT-5.5에서 비교한 결과 성공률이 평균 약 0.78에서 약 0.95로 상승했고 플랫 파일보다 토큰 비용이 낮았다고 보고됐다. 원문은 수치와 비교 절차를 댓글의 링크에 수학적 정식과 전체 비교표로 첨부했다고 밝히고 있다. 따라서 제시된 증거는 실험적 비교와 정형화된 수치로 뒷받침된 것으로 나타났다.

용어 해설

GraphRAG
GraphRAG는 문서 기반 RAG 구성에서 문맥을 연결하여 'brain'처럼 관리하는 방식으로 이해된다. 플랫 파일이나 단일 마크다운에서 문맥을 직접 주입하는 전통적 RAG와 달리 노드·엣지 형태로 지식 조각을 구조화하면 탐색이 용이해진다. 원문에는 GraphRAG를 'brain'이라 칭하며 비교 대상으로 사용한 것이 확인됐다.
부분 관찰 MDP(partially observable MDP)
부분 관찰 MDP는 에이전트가 완전한 환경 상태를 관찰하지 못할 때 상태 확률분포를 기반으로 의사결정을 수행하는 수학적 모델이다. 원문에서 이 구조는 관찰 가능한 상태를 노드로, 행동을 엣지로 매핑하고 엣지에 성공확률·토큰비용·결과를 가중치로 부여하는 방식으로 구현됐음이 확인됐다. 그러므로 에이전트는 그래프를 탐색해 성능 데이터를 수집하고 그 데이터를 바탕으로 탐험 후 활용(exploit)을 수행했다고 기술됐다.
Claude Opus 4.8
Claude Opus 4.8은 원문에서 실험에 사용된 LLM 중 하나로 명시됐다. 실험에서는 동일 작업 배치를 Claude Opus 4.8과 Codex GPT-5.5에 적용해 비교한 것으로 나타났다. 따라서 성능 수치 비교는 이 모델들을 포함한 환경에서 도출된 결과임이 확인됐다.

언급된 도구

Claude Opus 4.8중립

언어 모델로 실험에서 플랫 파일·GraphRAG·POMDP 기반 정책을 평가하는 데 사용된 모델이다.

Codex GPT-5.5중립

언어 모델로 Claude Opus 4.8과 동일한 작업 배치에서 비교 실험을 수행하는 데 사용된 모델이다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 30.수집 2026. 07. 30.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.