TL;DR
기업용 data agent의 검색은 단순한 질문에는 빠르게 답하면서도 복잡한 멀티홉 질문에는 추가 증거를 모아야 하므로 품질과 지연시간 사이의 조절이 필요합니다. Adaptive Instructed-Retriever는 여러 병렬 검색 질의를 한 라운드에 실행한 뒤 증거가 충분하면 조기에 종료하고, 부족하면 최대 4개 단계까지 순차 검색을 이어가는 정책을 학습합니다. CISPO 기반 Online Reinforcement Learning은 성능 향상 없이 늘어난 검색 단계에 벌점을 부과하며, 그 결과 모델은 검색 점수 52를 5.8초에 달성해 Claude Sonnet 5의 12.9초, DeepSeek-V4-Flash의 13.5초, GPT-5.6 Luna의 13.4초보다 낮은 지연시간을 기록했습니다. ORL의 step penalty를 바꾸면 속도 중심부터 품질 중심까지 여러 체크포인트를 만들 수 있어, Genie Code와 같은 data agent의 제품 지연시간 예산에 맞는 검색 정책을 선택할 수 있습니다.
섹션별 상세




용어 해설
- 온라인 강화학습(Online Reinforcement Learning)
- — 모델이 실제 검색 궤적을 생성하는 과정에서 보상과 벌점을 받아 정책을 갱신하는 학습 방식입니다. 이 글에서는 검색 품질이 높은 궤적에는 보상을 주고, 품질 향상 없이 추가된 검색 단계에는 비용을 부과해 요청별 검색량을 조절합니다.
- CISPO
- — Clipped Importance Sampling Policy Optimization의 약자로, 정책 업데이트 과정에서 중요도 샘플링 값을 제한해 온라인 강화학습의 변동성을 줄이는 최적화 방식입니다. Adaptive Instructed-Retriever의 검색 정책을 최종 성능과 검색 비용에 맞춰 조정하는 데 사용됩니다.
- 멀티홉 검색(Multi-hop Retrieval)
- — 한 번의 검색으로 답을 찾기 어려운 질문에서 검색 결과를 바탕으로 다음 질의를 만들고 여러 차례 증거를 모으는 방식입니다. 기업 데이터 환경에서는 표·문서·대시보드처럼 서로 다른 자료를 순차적으로 확인해야 하는 복합 질문에 적합합니다.
- 파레토 프런티어(Pareto Frontier)
- — 한 성능 지표를 더 높이려면 다른 지표를 포기해야 하는 선택지들 가운데, 어느 한쪽도 동시에 개선할 수 없는 운영점들의 경계입니다. 이 글에서는 검색 점수와 종단 간 지연시간 사이의 선택지를 나타내며, ORL의 step penalty로 서로 다른 체크포인트를 만듭니다.
- Recall@10
- — 검색 결과 상위 10개 안에 관련 문서가 포함되는 비율을 측정하는 검색 평가 지표입니다. 글의 벤치마크에서는 단일 단계 검색과 다단계 검색의 검색 품질을 비교하는 기준으로 사용됩니다.
기술
- Adaptive Instructed-Retriever
- Instructed-Retriever-1
- CISPO
- AI Runtime
- Claude Sonnet 5
- GPT-5.6 Luna
- DeepSeek-V4-Flash
- Genie Code
활용 사례
- 기업 workspace에서 표·노트북·대시보드·문서 검색
- 복수 문서의 증거를 연결하는 멀티홉 질의
- 대화형 data agent의 지연시간 제한 검색
- 오프라인 고품질 retrieval 작업
- 도메인별 검색 모델 특화 학습
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

