TL;DR
과학적 문헌 검색에서는 사용자의 구체적 선호와 의도가 한 번의 쿼리로 완전하게 표현되지 않는 경우가 많아 반복적 상호작용과 명확화가 필수적이다. PaperPilot는 검색 전략을 편집 가능한 워크플로로 명시화하여 자연어 피드백을 구조적 편집으로 전환함으로써 검색 결과의 관련성과 정렬도를 크게 향상시킨다. 이 접근은 단순한 쿼리 증강이나 고정 파이프라인보다 제어 가능성과 비용 효율성 면에서 우수하다고 평가되었다.
왜 중요한가
과학적 문헌 검색에서는 사용자의 구체적 선호와 의도가 한 번의 쿼리로 완전하게 표현되지 않는 경우가 많아 반복적 상호작용과 명확화가 필수적이다. PaperPilot는 검색 전략을 편집 가능한 워크플로로 명시화하여 자연어 피드백을 구조적 편집으로 전환함으로써 검색 결과의 관련성과 정렬도를 크게 향상시킨다. 이 접근은 단순한 쿼리 증강이나 고정 파이프라인보다 제어 가능성과 비용 효율성 면에서 우수하다고 평가되었다.
핵심 기여
워크플로 유도 공식화
앵커 논문과 사용자가 제시한 질의를 입력으로 받아 타입화된 paper-search 연산자 집합에서 연산자를 선택하고 파라미터를 설정해 실행 가능한 DAG를 구성하는 문제로 다중회차 문헌 검색을 공식화했다. 이 공식화는 중간 출력(논문 집합, 키워드, 점수, 증거)을 명시적으로 다루어 피드백을 구조적 편집으로 변환할 수 있게 한다. 워크플로는 타입 일관성 검사와 노드 단위 캐시를 통해 안정적 실행을 보장한다.
PaperPilot-Toolset 및 실행 가능한 DAG 설계
키워드 검색, 인용 확장, 집합 연산, 필터, 점수화, 재정렬, 증거 추출 등 논문 검색에 필요한 연산자를 타입 서명과 함께 정의해 워크플로 조합을 가능하게 했다. 각 노드는 연산자 인스턴스(연산자+파라미터)로 표현되며 엣지는 중간 결과의 흐름을 나타내 워크플로 실행과 편집에서 일관성을 유지했다. 이 설계는 사용자 지시를 연산자 파라미터 편집으로 직접 매핑하는 것을 허용한다.
워크플로 모방 학습과 선호도 최적화 학습 파이프라인
강한 교사 모델이 생성한 성공적 워크플로 궤적을 수집해 감독 학습(SFT)을 수행한 뒤, 성공 워크플로와 구조적·의미적 손상을 입힌 부적절 워크플로 쌍을 만들어 IPO 스타일 DPO로 선호도 최적화를 수행했다. 이 두 단계는 긴 컨텍스트의 DAG 생성에서 문법적·구조적 오류를 줄이고 편집 안정성을 높이는 데 기여했다. 학습 데이터는 2,723 케이스에서 추출된 5,540개의 감독 예시와 1,733개의 하드 선호 쌍으로 구성되었다.
다중회차 평가용 재현 가능한 벤치마크와 사용자 시뮬레이터
앵커 논문, 사용자 질의, 검색 방향(전임·후임·동료·벤치마크·서베이), 히든 골드 논문 집합을 고정한 평가 프로토콜을 도입하고 Qwen3.5-397B-A17B 기반의 사용자 시뮬레이터로 다중회차 상호작용을 재현했다. 시뮬레이터는 히든 골드 메타데이터를 참조하되 검색 에이전트는 접근 불가하도록 누수 통제를 수행해 비교의 재현성을 확보했다. 이 벤치마크는 단일회차와 다중회차 조건을 모두 포함한다.
실험을 통한 성능·비용·안정성 증명
PaperPilot-9B는 Qwen3.5-9B 기반 도구 사용 에이전트 대비 Hit@5를 58.0에서 77.0으로, MRR을 47.5에서 59.4로, nDCG@10을 26.8에서 32.5로 향상시켰고 워크플로 실행 오류율을 9.5%에서 0%로 감소시켰다. 동일 벤치마크에서 비용 효율성 측면에서도 더 유리한 트레이드오프를 보였으며 일부 상용 대형 시스템을 비용 대비 성능에서 능가했다. 결과는 워크플로 명시화와 편집 가능성이 검색 품질과 워크플로 안정성에 직접적 영향을 미친다는 것을 시사한다.
핵심 아이디어 이해하기
문헌 검색 문제는 입력 쿼리와 앵커 논문만으로는 사용자의 세부 의도를 온전히 포착하기 어렵고, 검색 전략은 인용 방향·최근성·메서드 유사성·응용 도메인 등 세부 선호에 따라 달라진다. 기존 접근은 대체로 자연어 맥락을 암시적으로 취급하거나 고정 파이프라인을 사용해 피드백을 단순 쿼리 확장으로 처리했기 때문에 사용자의 정밀한 의도 반영과 제어가 제한되었다. PaperPilot는 이 문제를 해결하기 위해 검색 연산자 집합을 명시적 워크플로로 조합하는 방식으로 출발한다.
방법론
PaperPilot는 PaperPilot-Toolset이라 불리는 타입화된 연산자 라이브러리에서 연산자를 선택하고 파라미터를 설정해 실행 가능한 DAG를 구성한다. 각 연산자 노드의 출력 타입이 다음 노드의 입력 타입과 일치해야 하므로 타입 검사로 불법적 연결을 방지하고 노드별 캐시를 통해 중복 계산을 줄인다. 롤아웃 단계에서 에이전트는 현재 상태(앵커 논문, 질의, 후보 집합, 상호작용 기록)를 바탕으로 DAG를 유도하고 노드 단위로 실행해 중간 후보를 생성한 뒤 사용자에게 결과나 명확화 질문을 제시한다.
관련 Figure

그림은 사용자가 앵커 논문과 질의를 제공했을 때 기존 단일회차 모델은 한 번의 검색으로 결과를 반환하는 반면 PaperPilot는 초기 DAG를 생성하고 사용자와의 반복적 명확화 과정을 통해 워크플로를 편집한 뒤 최종 결과를 출력하는 순서를 보여준다. 이 다이어그램은 워크플로 편집이 명확화·편집·최종화의 단계로 분리되어 수행된다는 논문 주장의 직관적 근거를 제공한다.
단일회차 검색과 PaperPilot의 다중회차 워크플로 기반 검색 흐름을 비교한 개념적 다이어그램이다.

그림은 앵커 논문, 사용자 질의, 방향성 지시를 입력으로 받아 초기 DAG 생성을 거치고 명확화 질문과 사용자 응답을 반영해 DAG를 수정·최종화하는 전체 플로우를 보여준다. 또한 에디터에서 노드별 연산자 타입과 편집 가능한 파라미터가 어떻게 표현되는지와 읽기(읽기·이해), 인용 확장, 통찰 합성 같은 워크플로 실행 단계가 연계되는 방식을 시각화한다.
PaperPilot 에이전트의 내부 구성과 Editable Typed-Operator DAG, 툴셋 인터페이스를 상세화한 아키텍처 다이어그램이다.
주요 결과
주요 회귀 실험에서 PaperPilot-9B는 다중회차 설정에서 Hit@5가 77.0, MRR이 59.4, nDCG@10이 32.5를 달성했고 워크플로 실행 오류율은 0%로 보고되었다. 비교 대상인 Qwen3.5-9B 기반 도구 에이전트는 동일 조건에서 Hit@5 58.0, MRR 47.5, nDCG@10 26.8, 워크플로 오류율 9.5%를 기록해 PaperPilot의 학습 파이프라인이 품질과 안정성에 유의미한 개선을 가져온 것이 확인됐다. 추가로 GPT-5.4 기반 시스템과 비교한 비용·성능 표에서 PaperPilot는 더 작은 모델로도 높은 비용효율을 달성한 사례가 제시되었다.
관련 Figure

그래프는 초기 턴에서 주로 명확화 질문(Ask user)이 수행되고 이후 턴으로 갈수록 워크플로 수정(Modify workflow)과 최종화(Finalize)의 비중이 증가하는 경향을 보여준다. 이 시각 결과는 논문이 주장한 대로 에이전트가 명확화·편집·최종화 단계를 분리해 순차적으로 수행한다는 점과 다중회차 상호작용의 역할 분화가 실제 데이터에서 관찰된다는 근거를 제공한다.
상호작용 턴별로 에이전트 행동 분포(사용자에게 질문·워크플로 수정·최종화 비율)를 보여주는 누적 막대 그래프이다.

그래프는 PaperPilot-9B가 Hit@5에서 58.0에서 77.0으로, MRR에서 47.5에서 59.4로 개선된 정량적 성능 이득을 시각적으로 요약한다. err% 항목은 워크플로 실행 오류가 9.5%에서 0.0%로 감소했음을 보여주어 학습 파이프라인이 편집 안정성에 미친 직접적 효과를 수치로 뒷받침한다.
Qwen3.5-9B 기반 툴셋(MT base)과 학습된 PaperPilot-9B(MT ours)의 Hit@5, R@50, MRR, nDCG@10, err% 비교 막대 그래프이다.

레이더 플롯은 PaperPilot-9B가 추가(added)·제거(removed)·수정(modified) 노드 조작에서 다른 모델들과 차이를 보이며 특히 로컬 편집 일관성에서 우수한 값을 기록한 것을 요약한다. 이 시각 데이터는 워크플로 편집 안정성 측정치와 연계되어 PaperPilot-9B의 편집 행동이 보다 일관적임을 뒷받침한다.
여러 모델이 워크플로 편집 시 추가·제거·수정한 노드 비율을 레이더형으로 비교한 시각화이다.

히트맵은 대부분의 지표가 K=8~10 근처에서 최고치에 가깝고 후보 풀을 키울수록 성능이 일관되게 개선되지 않음을 보여준다. 이 관찰은 후보 풀을 무작정 크게 확장하면 잡음이 늘어나 후속 필터링·재정렬 단계의 성능을 저해할 수 있다는 실험적 근거를 제공한다.
키워드 풀 스케일 K에 따른 다양한 검색 지표(Hit@1, Hit@5, R@15, R@50, nDCG@15, MRR)를 히트맵 형태로 나타낸 그림이다.
기술 상세
전체 아키텍처는 입력 컨텍스트(앵커 논문 p0, 사용자 질의 q, 후보 집합, 상호작용 히스토리)를 받아 DAG 유도 모듈이 PaperPilot-Toolset에서 연산자와 파라미터를 선택해 G_t를 생성하는 구조이다. 생성된 DAG는 타입 검사를 통과한 뒤 노드별로 순차 실행되어 중간 후보 집합과 점수, 증거 스니펫을 생성하고 이 결과는 사용자 인터페이스로 노출되거나 명확화 질문 생성에 사용된다. 학습은 두 단계로 진행되어 먼저 교사 모델의 성공 궤적을 이용한 감독학습(SFT)을 수행한 뒤 성공·부적절 워크플로 쌍에 대해 IPO 스타일 DPO로 선호도 최적화를 시행해 편집 안정성과 선호 일치를 강화했다.
관련 Figure

그래프는 PaperPilot-9B가 전체 워크플로와 서브필드(쿼리·필터·시그니처)에서 Qwen3.5-9B 대비 높은 TF-IDF 코사인 유사도를 기록해 교사 궤적과의 텍스트 유사성이 향상되었음을 시사한다. 이 결과는 워크플로 유도 학습이 단순 템플릿 출력에서 벗어나 구조적·문맥적 구성 요소를 더 잘 재현함을 정량적으로 보여준다.
워크플로 구성 요소별 TF-IDF 코사인 유사도를 모델별로 비교한 막대 그래프(Whole DAG, Query, Filter, Signature)이다.
한계점
PaperPilot는 미리 정의된 심볼릭 연산자 라이브러리에 의존하므로 도메인 특화된 검색 행동이나 사용자별 고유 작업을 완전하게 포괄하지 못할 수 있다. 워크플로 감독 데이터가 교사 모델에 의해 생성되므로 교사 모델의 편향이나 사각지대가 학습 데이터에 전이될 우려가 존재한다. 평가 벤치마크가 주로 컴퓨터 과학 문헌에 집중되어 있어 타학문 분야에서의 일반화 가능성은 추가 검증이 필요하다.
실무 활용
PaperPilot는 앵커 논문 기반의 심화된 문헌 검색, 특정 메서드의 후속 연구 탐색, 벤치마크 기반 관련작업 식별 등 연구자 워크플로에 직접 적용 가능성이 높다. 실행 가능한 워크플로 표현은 사용자 피드백을 직접적인 편집 명령으로 전환해 반복적 세분화 작업에서 시간과 비용을 절감할 가능성이 있다. 공개된 코드 저장소가 존재해 연구·개발 환경에서 재현과 확장이 용이하다.
- 특정 논문의 후속 연구나 직접 인용 후속만을 골라내기 위한 정교한 검색 파이프라인 구성
- 연구 분야의 강력한 baseline을 판별하기 위해 인용 기반 확장과 벤치마크 필터를 조합하는 탐색
- 리뷰·서베이 작성 시 다양한 검색 전략을 반복적으로 편집해 골든셋을 수집하는 워크플로 자동화
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Workflow Induction
- — 사용자 질의와 앵커 논문을 입력으로 받아 유형화된 검색 연산자 집합을 조합해 실행 가능한 DAG(Directed Acyclic Graph) 형태의 검색 워크플로를 생성하고, 사용자 피드백으로 워크플로 구조와 파라미터를 편집하여 검색 행동을 점진적으로 맞추는 기법이다. 이 방식은 자연어 피드백을 단순한 쿼리 확장이 아닌 구조적 편집 명령으로 해석해 연산자 선택 및 연결을 변경함으로써 의도에 특화된 검색 전략을 구성할 수 있게 한다. 워크플로 유도는 검색 전략의 가시성, 제어 가능성, 재사용성을 높이는 것이 핵심 중요성이다.
- Executable DAG
- — 각 노드가 명시적 입력·출력 타입과 파라미터를 지닌 연산자(invoked operator)를 나타내고 엣가는 중간 결과(논문 집합, 키워드, 점수 등)의 흐름을 표현하는 방향성 비순환 그래프 구조이다. 이 구조는 타입 일관성 검사를 통해 잘못된 연결을 방지하고 노드별 캐시 재사용을 허용해 반복적 상호작용에서 계산 비용을 줄인다. 논문 검색에서는 키워드 검색, 인용 확장, 필터링, 재정렬, 증거 추출 같은 연산자를 조합해 최종 랭킹을 산출하는 실행 단위로 사용된다.
- Paper-Search Operator
- — 검색 파이프라인을 구성하는 원자적 기능 단위로서 키워드 검색, 인용 확장(forward/backward citation), 집합 연산(union/dedup), 필터링(predicate), 점수화(scoring), 재정렬(reranking), 증거 추출(evidence extraction) 등을 포함한다. 각 연산자는 입력·출력 타입을 가지므로 DAG 내에서 합법적인 조합과 파라미터 설정이 가능하며, 사용자 지시로 연산자 추가·수정·삭제가 이루어지는 편집 단위가 된다. 연산자 설계는 검색 정확도와 편집의 견고성에 직접적 영향을 미친다.
- Preference Optimization
- — 교사 모델이 생성한 성공적 워크플로와 구조적·의미적 손상을 가한 부적절 워크플로 쌍을 만들고, 선택된 쌍에 대해 비교학습(objective)을 적용해 모델이 선호하는 쪽을 확률적으로 높이는 학습 절차이다. 논문에서는 IPO 스타일의 DPO(objective)를 사용해 긴 컨텍스트의 DAG 생성에서 안정적인 선호 신호를 확보했고, 이로 인해 편집 오류가 감소했다. 이 방법은 단순한 교차엔트로피 학습만으로는 포착하기 어려운 정성적 선호를 반영하는 데 유용하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



