본문으로 건너뛰기

RL-Index: Retrieval Index Reasoning을 위한 Reinforcement Learning

검색이 실제 해결책과 논리적으로 연결되는 경우(예: 수학 정리, 코드 동작 원리) 기존 임베딩·문자열 매칭은 적절한 문서를 찾지 못할 수 있다. RL-Index는 문서 인덱싱 단계에서 LLM 기반의 설명(rationale)을 자동으로 추가해 이러한 논리적 간극을 메우고, 온라인 쿼리 시 대규모 LLM 호출을 줄여 응답 지연을 대폭 낮춘다.

용어 해설

검색 증강 생성(RAG)
검색 증강 생성(RAG)은 외부 지식을 검색해 생성 모델의 입력으로 넣어 응답 품질을 높이는 기법이다. 질의에 대해 관련 문서를 먼저 검색하고, 검색 결과를 컨텍스트로 제공해 생성기의 답변 정확도를 개선한다. 본문에서는 온라인(query-side)과 오프라인(index-side) 방식의 rationale 생성을 대조한다.
밀집 벡터 기반 검색기(Dense Retriever)
Dense Retriever는 문서와 질의를 임베딩 공간으로 매핑한 뒤 코사인 유사도 등으로 검색하는 방식이다. 임베딩은 문장 수준 의미를 포착하지만 문서와 질의 사이의 복잡한 논리적 관계를 항상 포착하지 못해 본 논문의 보강 대상이 된다.
임베딩(벡터 표현)(Embedding)
Embedding은 텍스트를 실수 벡터로 변환하는 방법이다. 질의 q와 문서 d가 주어지면 인코더가 각각 임베딩을 계산하고, 코사인 유사도 등의 연산으로 관련도를 평가한다. 본문에서는 임베딩 유사도(코사인)를 보상 신호로 사용한다.
정규화 누적 이득 nDCG@10(nDCG@10)
nDCG@10은 상위 10개 검색 결과의 관련도 순서를 고려한 랭킹 지표이다. 각 결과의 기여를 로그 스케일로 가중합해 계산하고 정규화해 0~1 범위로 표현한다. 본문에서는 BRIGHT 벤치마크 평가에 nDCG@10을 사용한다.
Group Relative Policy Optimization(GRPO)
GRPO는 그룹 단위로 샘플된 후보들 사이에서 상대적 우위를 학습하는 정책 최적화 기법이다. 한 문서에 대해 K개의 증강본을 샘플하고 각 증강의 보상을 정규화해 상대적 advantage를 계산한 뒤, 중요도 비율과 clipping을 적용해 정책을 업데이트한다. 본 논문에서 rationale 품질 최적화에 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 15.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.