TL;DR
대형 언어모델은 사전학습 지식에 의존할 때 최신성이나 도메인 지식 결핍으로 오답을 생성할 가능성이 있고, 단일 단계의 정적 RAG는 한 번의 검색에서 잡음이 포함된 큰 문맥 때문에 추론이 흐려질 수 있다. GRASP는 에이전트가 단계별로 언제 어떤 검색 도구를 쓰고 문맥을 문장 수준에서 문단 수준으로 확장할지를 학습하게 하여 필요할 때만 넓은 문맥을 노출시키고 불필요한 잡음을 억제한다. 이로 인해 다중 홉 질의에서 금지된 중간 오류의 전파와 근거 없는 환각을 줄이면서 회수율과 QA 성능을 동시에 개선했다.
왜 중요한가
대형 언어모델은 사전학습 지식에 의존할 때 최신성이나 도메인 지식 결핍으로 오답을 생성할 가능성이 있고, 단일 단계의 정적 RAG는 한 번의 검색에서 잡음이 포함된 큰 문맥 때문에 추론이 흐려질 수 있다. GRASP는 에이전트가 단계별로 언제 어떤 검색 도구를 쓰고 문맥을 문장 수준에서 문단 수준으로 확장할지를 학습하게 하여 필요할 때만 넓은 문맥을 노출시키고 불필요한 잡음을 억제한다. 이로 인해 다중 홉 질의에서 금지된 중간 오류의 전파와 근거 없는 환각을 줄이면서 회수율과 QA 성능을 동시에 개선했다.
관련 Figure

이 그림은 문장 수준과 문단 수준의 문맥 세분도가 추론 결과에 미치는 영향을 대비해 보인다. 그림은 잘못된 문서가 포함된 큰 문단이 모델의 주의를 분산시켜 환각을 유발하는 사례와 단계적 검색이 비적절한 검색 도구 선택으로 인해 오류를 증폭하는 과정을 보여준다. 따라서 단계별로 검색 신호와 문맥 그레인을 제어해야 올바른 다중 홉 연결을 확보할 수 있다는 논문의 핵심 논리를 강화한다.
다중 홉 추론에서 단일 단계 검색이 관련 증거를 포함하더라도 거대한 문맥의 잡음으로 인해 모델이 잘못된 연결을 만들고 에이전트형 반복 검색에서는 중간 오류가 누적될 수 있음을 시각화한 모티베이션 그림이다.
핵심 기여
에이전트형 RAG의 적응형 검색 도구 선택을 RL 문제로 공식화
에이전트가 추론문을 생성한 뒤 세 가지 도구(semantic search, keyword search, read paragraph) 중에서 선택하고 필요시 최종 응답을 반환하도록 MDP로 정의했다. 상태에는 쿼리·상호작용 이력·남은 턴 예산이 포함되며, 에이전트가 생성한 추론·도구 호출·관찰이 순차적으로 히스토리에 누적된다.
정답 정확도와 증거 기반 행동을 동시에 유도하는 복합 보상 설계
궤적 수준의 보상을 정답 F1(R_A)과 읽기 기반 근거 점수(R_R), 보완적 검색 성공 여부(R_S), 턴 효율(R_E)을 합산해 정의했다. 보조 보상의 가중치는 α=0.7, β=0.15, γ=0.15로 설정해 근거 확보를 우선하되 답 정확도를 주된 목표로 유지했다.
GRPO 기반 그룹 단위 정책 업데이트로 안정적인 다중 궤적 학습
같은 질의에서 그룹 샘플링된 G개의 궤적을 상대 비교하는 GRPO를 사용해 정책을 업데이트함으로써 절대 보상 스케일에 의한 불안정성을 완화했다. 각 궤적은 도구 호출, 읽은 문서, 사용 턴 수를 포함해 보상이 계산되며 레퍼런스 LLM의 KL 패널티가 적용된다.
문장 수준 검색과 문단 확장 조합으로 회수율과 QA 성능 개선
HotpotQA, 2WikiMultiHopQA, MuSiQue에서 GRASP는 문장 단위 탐색으로 브로드 탐색을 수행하고 필요시 read paragraph로 문단을 확장해 근거를 검증하는 행동을 학습했다. 이 정책은 단일 단계 또는 고정 문단 검색 기반 기법보다 검색 회수율과 EM/F1/JD 지표에서 우수한 성능을 보였다.
핵심 아이디어 이해하기
다중 홉 질문은 각 중간 연결고리에 정확한 근거가 필요하며, 큰 덩어리의 문맥은 관련 증거를 희석시켜 모델이 잘못된 단서에 집중하게 만든다. 이러한 문제는 정적 RAG에서 한 번의 검색으로 모든 후보를 가져올 때 특히 심각하며, 에이전트형 접근에서도 잘못된 중간 검색이 이어져 오류가 누적될 수 있다. 따라서 검색 도구 선택과 반환되는 문맥의 세분도를 단계별로 제어하는 것이 핵심 과제이다.
방법론
GRASP는 에이전트형 RAG를 유한시한 MDP로 구성해 상태 공간에 질의, 상호작용 이력, 이전 도구 호출과 남은 턴 예산을 포함시켰다. 행위 공간은 의미 검색(τ_s), 키워드 검색(τ_k), 문단 읽기(τ_r), 종료(τ_a)로 정의했고 의미 검색과 키워드 검색은 문장 단위로 상위 K개의 문장을 반환하며 문단 읽기는 해당 문장의 소속 문단을 확장해 반환한다. 보상은 궤적 수준으로 합성되어 정답 F1(R_A)을 기본 축으로 하고 읽기 기반 근거 보상(R_R), 보완적 검색 보상(R_S), 턴 효율 보상(R_E)을 추가해 총합 R=R_A+αR_R+βR_S+γR_E로 계산하며 보조 보상의 가중치는 α=0.7, β=0.15, γ=0.15로 설정했다. 학습은 Group-Relative Policy Optimization(GRPO)을 사용해 같은 질의에서 샘플한 G개의 궤적을 그룹 단위로 비교하고 레퍼런스 LLM에 의한 KL 패널티로 정책 폭주를 제어했다.
관련 Figure

이 다이어그램은 에이전트가 reasoning → 검색 도구 호출 → 관찰 수신 → 문단 확장 → 최종 응답의 반복 루프를 어떻게 구성하는지 구조적으로 제시한다. 또한 각 롤아웃이 보상 모델에 의해 채점되고 레퍼런스 LLM으로부터 KL 패널티를 받아 그룹 단위로 GRPO로 업데이트되는 학습 흐름을 명확히 보여줘 방법론 섹션의 수식적 구성과 구현 세부를 시각적으로 보강한다.
GRASP 프레임워크의 전체 파이프라인을 보여주는 다이어그램으로 정책 LLM, 세 가지 검색 도구, 보상 모델과 레퍼런스 LLM, 그리고 GRPO 기반의 정책 업데이트 흐름을 포함한다.
주요 결과
검색 측면에서 GRASP는 HotpotQA에서 회수율 0.90, 2Wiki에서 0.90, MuSiQue에서 0.70을 기록해 표본 비교군 중 최고 성능을 보였다. QA 성능은 HotpotQA에서 EM 0.53, F1 0.66, JD 0.71을 기록했고 2Wiki에서는 EM 0.52, F1 0.60, JD 0.63, MuSiQue에서는 EM 0.23, F1 0.33, JD 0.34으로 다중 홉 벤치마크 전반에서 prompting 기반 또는 단일 단계 기반 방법보다 우수했다. 제거 실험에서는 문단 확장 τ_r을 제거하고 문단 수준 고정으로 회귀시키면 EM이 0.388로 떨어져 −0.122의 하락을 보였고, 의미 검색 τ_s를 제거하면 EM이 0.438로 −0.072 하락했으며 키워드 검색 τ_k를 제거했을 때는 EM이 0.498로 −0.012 감소해 의미 검색과 문단 확장 요소의 영향이 더 크게 관찰됐다.
기술 상세
전체 아키텍처는 정책 LLM이 추론 세그먼트를 생성하고 그에 따라 검색 도구를 호출하면 관찰을 받아 히스토리에 누적하는 반복 구조로 구성된다. 검색 코퍼스는 문단을 문장 단위로 분해해 색인하고 각 문장은 부모 문단 식별자 f(s)를 보유해 문장 수준 검색 후 필요시 τ_r로 문단을 확장할 수 있도록 구현했다. 보상 항은 정답 보상 R_A=F1(ŷ,y)와 읽기 보상 R_R=F1(D_r,D_g), 보완 검색 보상 R_S=1[ D_s∩D_g≠∅ ∧ D_k∩D_g≠∅ ], 효율 보상 R_E=(T−T_cur)/T · 1[R_A>0.5]의 합으로 정의되어 보조 신호가 정답 정확도를 잠식하지 않도록 설계했다. 학습은 그룹 단위로 G개의 궤적을 샘플링해 각 궤적의 궤적 수준 보상을 계산한 뒤 GRPO로 정책을 업데이트하며 레퍼런스 LLM으로부터의 KL 패널티를 도입해 분포의 급격한 변화와 과도한 탐욕적 행동을 억제했다.
한계점
제안한 보상 설계는 골드 서포팅 문단 주석에 의존하므로 주석이 없는 실세계 코퍼스로 바로 일반화하기 어렵다. 학습된 정책은 가끔 보수적 조기 종료나 필요한 증거를 충분히 수집하지 못하는 불완전 회수 문제를 보였고 이러한 실패 모드는 추가적인 보상형태나 자기평가 신호로 완화할 필요가 있다. 실험은 Qwen2.5-3B-Instruct 단일 백본에 한정되어 있어 모델 규모에 따른 행동 패턴과 도구 사용의 확장성은 추가 평가가 필요하다.
실무 활용
GRASP의 정책 학습 방식은 다중 홉 질의를 처리하는 Q&A 시스템이나 문서 중심의 질의응답 파이프라인에서 단계별 검색 전략을 자동화할 때 실무적으로 유용하다. 문장 수준으로 필요한 근거를 먼저 좁히고 검증할 때만 문단을 확장하므로 컨텍스트 윈도우 사용을 효율화하면서 환각을 줄일 수 있다. 다만 현재 보상 설계가 골드 서포팅 문단 주석에 의존하므로 생산 환경 도입 전에는 약한 감독 신호로 보완할 필요가 있다.
- 대규모 문서 코퍼스에서 다중 홉 질문을 처리하는 지식형 챗봇의 검색-추론 파이프라인에서 중간 질의 자동화와 근거 검증을 위한 정책으로 활용할 수 있다.
- 문서 요약이나 정보추출 전 단계에서 관련 문장만 선별해 구체적 증거를 확보하는 루틴에 적용해 downstream 모델의 입력 잡음을 줄일 수 있다.
- 도메인별 질의응답(법률·의료 등)에서 보수적으로 문단을 확장하고 근거 읽기를 우선하는 전략으로 사실성 검사를 강화하는 보조 정책으로 사용될 수 있다.
코드 공개 여부: 미확인
키워드
용어 해설
- Agentic RAG
- — 에이전트형 RAG는 LLM이 반복적으로 추론문을 생성하고 검색 질의를 만들어 외부 문서를 단계적으로 조회하면서 답을 구성하는 방식이다. 이 방식은 단계별 중간 상태에 따라 검색 전략을 동적으로 바꿀 수 있어 다중 홉 추론에서 유리하지만, 잘못된 중간 검색이 이후 단계로 전파되면 오류가 누적될 위험이 있다.
- Semantic Search
- — 의미 기반 검색은 쿼리와 문장 또는 문단을 임베딩 공간에서 유사도로 비교해 관련 정보를 회수하는 방법이다. 어휘적 일치가 없더라도 개념적으로 관련된 증거를 찾아낼 수 있어 다중 홉 연결고리 탐색에 유용하다.
- Lexical Search
- — 어휘 기반 검색은 BM25와 같은 방법으로 쿼리와 문서의 단어 겹침을 기준으로 관련 문장을 찾아낸다. 실체명이나 정확한 어구 증거를 회수하는 데 강점이 있어 의미 검색과 보완적으로 활용될 때 효과적이다.
- Context Granularity
- — 문맥 세분도는 검색 결과로 반환하는 텍스트 단위의 크기 수준을 뜻한다. 문장 수준은 증거를 명확히 추적하기 쉽고 잡음이 적은 반면, 문단 수준은 더 많은 배경 정보를 제공하므로 필요에 따라 확장 또는 축소하는 결정이 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


