본문으로 건너뛰기

Adaptive Instructed-Retriever의 적응형 검색

Adaptive Instructed-Retriever가 필요한 질문에만 순차 검색을 추가해 검색 품질 52를 5.8초에 달성합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기업용 data agent의 검색은 단순한 질문에는 빠르게 답하면서도 복잡한 멀티홉 질문에는 추가 증거를 모아야 하므로 품질과 지연시간 사이의 조절이 필요합니다. Adaptive Instructed-Retriever는 여러 병렬 검색 질의를 한 라운드에 실행한 뒤 증거가 충분하면 조기에 종료하고, 부족하면 최대 4개 단계까지 순차 검색을 이어가는 정책을 학습합니다. CISPO 기반 Online Reinforcement Learning은 성능 향상 없이 늘어난 검색 단계에 벌점을 부과하며, 그 결과 모델은 검색 점수 52를 5.8초에 달성해 Claude Sonnet 5의 12.9초, DeepSeek-V4-Flash의 13.5초, GPT-5.6 Luna의 13.4초보다 낮은 지연시간을 기록했습니다. ORL의 step penalty를 바꾸면 속도 중심부터 품질 중심까지 여러 체크포인트를 만들 수 있어, Genie Code와 같은 data agent의 제품 지연시간 예산에 맞는 검색 정책을 선택할 수 있습니다.

섹션별 상세

01
단일 단계 병렬 검색은 많은 기업용 질의에 빠르게 대응하지만, 여러 문서와 데이터 자산을 연결해야 하는 멀티홉 질문에서는 추가 증거 수집이 필요합니다. Adaptive Instructed-Retriever는 사용자 질의와 스키마·지침을 입력받아 한 라운드에 여러 Query와 Filter를 병렬 실행하고 결과를 결합합니다. 증거가 충분하면 즉시 상위 문서를 반환하고, 부족하면 다음 검색 라운드를 시작하되 최대 4개 단계 안에서 종료합니다. 이 구조는 Genie Code처럼 계속 바뀌는 workspace에서 표·노트북·대시보드·문서를 찾아야 하는 data agent가 단순 조회에는 짧게 응답하고 어려운 탐색에는 계산을 더 쓰게 만듭니다.
사용자 질의와 스키마·지침을 받은 Adaptive Instructed-Retriever가 병렬 검색과 조기 종료를 반복하는 구조도입니다.
Diagram모델은 Query와 Filter를 여러 개 병렬 실행하고 결과를 결합한 뒤 증거가 충분하면 Top-k 문서를 반환합니다. 증거가 부족하면 다시 검색하며, 충분한 증거를 얻거나 4개 검색 단계에 도달하면 종료해 순차 검색의 지연시간을 제한합니다.
02
Instructed-Retriever-1의 빠른 병렬 검색 능력을 유지하면서 멀티홉 질문을 처리하려면 단일 단계용 기존 데이터와 추가 합성 멀티홉 질문이 함께 필요합니다. Databricks는 합성 기업 검색 환경과 KARL report와 유사한 agentic data synthesis 절차로 학습 데이터를 구성하고, pretrained base model 위에 소규모 특화 학습을 진행했습니다. 이후 Online Reinforcement Learning에서 CISPO를 사용해 검색 궤적의 품질에는 보상을 주고, 최종 성능 향상으로 이어지지 않은 추가 단계에는 step penalty를 적용했습니다. 그 결과 모델은 질문마다 필요한 계산량을 스스로 조절하는 검색 정책을 학습했으며, AI Runtime은 같은 방식을 고객의 도메인과 workload에 적용할 수 있는 학습 기반을 제공합니다.
03
7개 내부·외부 held-out benchmark와 여러 검색 난이도 및 도메인을 섞은 평가에서 Adaptive Instructed-Retriever의 다단계 Recall@10은 52, 평균 종단 간 지연시간은 5.8초였습니다. 같은 비교에서 Claude Sonnet 5는 Recall@10 51과 12.9초, DeepSeek-V4-Flash는 51과 13.5초, GPT-5.6 Luna는 52와 13.4초를 기록했습니다. Adaptive Instructed-Retriever는 단일 단계 검색보다 다단계 검색에서 품질을 크게 높이면서도 비교 모델보다 2배 이상 낮은 지연시간을 보였습니다. 글의 사례에서도 명시적인 restructuring costs 항목의 부재를 확인하는 질문에는 2단계에서 멈추고, LiteLLM Proxy 사용 고객을 찾는 질문에는 두 번째 라운드에서 구체적인 계정 가설로 전환해 Recall@10 0.75를 얻었습니다.
Adaptive Instructed-Retriever와 Claude Sonnet 5, DeepSeek-V4-Flash, GPT-5.6 Luna의 검색 점수와 종단 간 지연시간을 비교한 막대그래프입니다.
ChartAdaptive Instructed-Retriever는 검색 점수 52와 지연시간 5.8초를 기록합니다. Claude Sonnet 5는 51·12.9초, DeepSeek-V4-Flash는 51·13.5초, GPT-5.6 Luna는 52·13.4초로 나타나며, 비교 가능한 품질에서 Adaptive Instructed-Retriever의 지연시간이 약 2배 낮습니다.
단일 단계와 다단계 검색의 Recall@10 및 모델별 종단 간 지연시간을 비교한 그래프입니다.
ChartAdaptive Instructed-Retriever는 단일 단계 Recall@10 41에서 다단계 52로 상승하며 5.8초의 지연시간을 보입니다. 비교 모델의 다단계 점수는 51 또는 52로 비슷하지만 지연시간은 12.9초에서 13.5초 사이여서, 다단계 검색 품질을 유지하면서 더 짧은 응답 시간을 달성한 차이가 드러납니다.
04
ORL 학습 중 step penalty의 크기를 바꾸면 검색 단계와 품질 사이의 운영점을 여러 개 만들 수 있습니다. 낮은 penalty에서는 모델이 더 많은 단계를 사용해 높은 점수를 추구하고, 높은 penalty에서는 추가 탐색을 줄여 지연시간을 낮춥니다. 이렇게 만든 체크포인트들은 품질·지연시간 평면의 Pareto frontier를 이루며, 글에서는 전체 retrieval budget 범위에서 DeepSeek-V4-Flash, Claude Sonnet 5, GPT-5.6 Luna보다 유리한 위치를 차지한다고 제시합니다. 따라서 대화형 제품은 빠른 체크포인트를, 오프라인 검색이나 어려운 발견 작업은 높은 품질의 체크포인트를 선택할 수 있습니다.
ORL 학습의 step penalty를 조절해 검색 품질과 지연시간 사이의 여러 운영점을 얻는 Pareto frontier 그래프입니다.
Chartstep penalty가 낮을수록 더 많은 검색 단계를 사용해 Recall@10을 높이고, penalty가 높을수록 탐색을 줄여 지연시간을 낮춥니다. 그래프의 Adaptive Instructed-Retriever 운영점은 Recall@10 46부터 52까지의 선택지를 제공하며, 최고 점수 지점은 약 5.6초로 비교 모델의 약 13초대 지연시간보다 빠릅니다.

용어 해설

온라인 강화학습(Online Reinforcement Learning)
모델이 실제 검색 궤적을 생성하는 과정에서 보상과 벌점을 받아 정책을 갱신하는 학습 방식입니다. 이 글에서는 검색 품질이 높은 궤적에는 보상을 주고, 품질 향상 없이 추가된 검색 단계에는 비용을 부과해 요청별 검색량을 조절합니다.
CISPO
Clipped Importance Sampling Policy Optimization의 약자로, 정책 업데이트 과정에서 중요도 샘플링 값을 제한해 온라인 강화학습의 변동성을 줄이는 최적화 방식입니다. Adaptive Instructed-Retriever의 검색 정책을 최종 성능과 검색 비용에 맞춰 조정하는 데 사용됩니다.
멀티홉 검색(Multi-hop Retrieval)
한 번의 검색으로 답을 찾기 어려운 질문에서 검색 결과를 바탕으로 다음 질의를 만들고 여러 차례 증거를 모으는 방식입니다. 기업 데이터 환경에서는 표·문서·대시보드처럼 서로 다른 자료를 순차적으로 확인해야 하는 복합 질문에 적합합니다.
파레토 프런티어(Pareto Frontier)
한 성능 지표를 더 높이려면 다른 지표를 포기해야 하는 선택지들 가운데, 어느 한쪽도 동시에 개선할 수 없는 운영점들의 경계입니다. 이 글에서는 검색 점수와 종단 간 지연시간 사이의 선택지를 나타내며, ORL의 step penalty로 서로 다른 체크포인트를 만듭니다.
Recall@10
검색 결과 상위 10개 안에 관련 문서가 포함되는 비율을 측정하는 검색 평가 지표입니다. 글의 벤치마크에서는 단일 단계 검색과 다단계 검색의 검색 품질을 비교하는 기준으로 사용됩니다.

기술

  • Adaptive Instructed-Retriever
  • Instructed-Retriever-1
  • CISPO
  • AI Runtime
  • Claude Sonnet 5
  • GPT-5.6 Luna
  • DeepSeek-V4-Flash
  • Genie Code

활용 사례

  • 기업 workspace에서 표·노트북·대시보드·문서 검색
  • 복수 문서의 증거를 연결하는 멀티홉 질의
  • 대화형 data agent의 지연시간 제한 검색
  • 오프라인 고품질 retrieval 작업
  • 도메인별 검색 모델 특화 학습

언급된 리소스

문서KARL report
문서AI Runtime
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.