TL;DR
지식 기반 VQA는 이미지에서 식별된 실체에 대해 외부 지식원을 탐색하여 대답을 완성해야 하는 과제를 포함하며, 긴꼬리 엔티티에서는 단일 검색 단계가 실패하기 쉽다. ProMSA는 이미지 검색과 텍스트 검색을 예산 제약 하에서 순차적으로 선택하고 중복을 제거해 증거를 점진적으로 축적하도록 설계되어 단일 샷 RAG의 한계를 극복한다. 이 접근은 증거 수집과 추론을 밀접하게 결합해 장기적 증거 체인과 잘못된 초기 검색의 수정 가능성을 개선한다.
왜 중요한가
지식 기반 VQA는 이미지에서 식별된 실체에 대해 외부 지식원을 탐색하여 대답을 완성해야 하는 과제를 포함하며, 긴꼬리 엔티티에서는 단일 검색 단계가 실패하기 쉽다. ProMSA는 이미지 검색과 텍스트 검색을 예산 제약 하에서 순차적으로 선택하고 중복을 제거해 증거를 점진적으로 축적하도록 설계되어 단일 샷 RAG의 한계를 극복한다. 이 접근은 증거 수집과 추론을 밀접하게 결합해 장기적 증거 체인과 잘못된 초기 검색의 수정 가능성을 개선한다.
핵심 기여
예산 기반 점진적 멀티모달 검색 에이전트(ProMSA)
ProMSA는 단일 멀티모달 정책으로 img_search, text_search, stop 세 가지 행동을 생성해 이미지·텍스트 검색을 적응적으로 선택하는 에이전트 구조이다. 각 검색 호출은 제외 목록을 사용해 중복을 방지하고, 반환된 긴 페이지는 질문 조건의 요약 스니펫으로 압축되어 다음 의사결정에 입력된다. 이 설계로 에이전트는 불확실할 때 추가 검색을 수행하고 증거가 충분하면 중단해 제한된 도구 예산을 효율적으로 사용한다.
도구-호라이즌 정규화 GSPO(TN-GSPO)
TN-GSPO는 시퀀스 수준 정책 최적화에서 생성 길이뿐 아니라 도구 상호작용 깊이도 정규화에 포함해 업데이트 스케일을 조정하는 기법이다. 정규화 항 D(τ)=L(τ)(1+c·H(τ)^α)를 통해 학습 신호가 텍스트 길이 변동과 도구 호출 깊이의 영향을 함께 반영하도록 설계했다. 이 방식은 생성 길이 편향을 줄이고 도구 사용이 많은 어려운 궤적에 적절한 학습 스케일을 부여한다.
리젝션 샘플링 기반 SFT와 단계적 RL 학습 파이프라인
학습은 먼저 리젝션 샘플링으로 구성한 소규모 SFT 데이터로 도구 호출 형식과 기본 상호작용 패턴을 학습한 뒤, TN-GSPO로 시퀀스 수준 강화학습을 수행하는 두 단계로 진행된다. SFT 단계는 잘못된 형식에 의한 초기 탐색 실패를 줄이고 RL 단계는 도구 사용 정책을 최적화해 증거 수집-정지 균형을 개선한다. 실험에서는 이 두 단계가 합쳐져 성능과 안정성 모두 향상되는 효과가 관찰되었다.
E-VQA·InfoSeek에서의 일관된 성능 향상과 상세한 분석
ProMSA는 E-VQA와 InfoSeek 데이터셋에서 기존 RAG 기반 및 에이전트 기반 강력한 베이스라인을 상회하는 성능을 달성했다. 논문은 도구 가용성, Top-k, 도구 예산 등 설계적 변수에 대한 정량적 절삭 실험과 훈련 단계별 기여를 제시했다. 또한 도구 호출 비율, 응답 길이, 검색 정확도 등 학습 동역학을 시각화해 내부 동작을 검증했다.
핵심 아이디어 이해하기
KB-VQA 문제는 이미지 이해와 외부 지식 검색을 결합해야 한다는 점에서 두 가지 불확실성에 직면한다. 첫째는 '어떤 모달리티로 검색할 것인가'이며 이미지에 실체 식별이 불확실하면 이미지 검색, 실체가 알려졌지만 속성이 부족하면 텍스트 검색이 적절하다. 둘째는 '얼마나 깊게 검색할 것인가'인데 초기 결과가 틀리면 동일한 페이지들을 반복 수집해 편향이 누적될 수 있으므로 반복 검색과 중복 제거가 필요하다. ProMSA는 위 두 불확실성에 대응하기 위해 단일 생성 정책 πθ로 zt(추론 텍스트), ut(행동 토큰), argst(쿼리·top-k·제외 목록)를 순차 생성하게 구성했다. 이 정책은 상태 st에 기반해 img_search, text_search, stop을 선택하고 도구 호출 응답을 질문-조건 요약으로 압축해 다음 상태로 갱신한다. 압축된 요약은 중요한 엔티티 서술과 핵심 속성만 보존해 상태 성장량을 제어하며, 제외 목록을 통해 이전에 본 후보를 배제해 잘못된 초기 탐색의 편향을 완화한다. 학습 관점에서는 도구 호출이 궤적의 난이도를 좌우하므로 시퀀스 수준 보상을 사용하며 생성 길이와 도구 상호작용 깊이에 따라 업데이트 스케일을 조정하는 TN-GSPO를 도입해 안정성을 확보한다.
방법론
전체 접근 방식은 입력 이미지와 질문 쌍을 받으면 에이전트가 여러 라운드에 걸쳐 검색과 추론을 교대로 수행하도록 구성되어 있다. 각 타임스텝에서 정책은 reasoning 텍스트 zt, 행동 토큰 ut, 행동 인자 args_t(쿼리·top-k·exclude 목록)를 생성하고, img_search와 text_search는 각 호출마다 후보 위키피디아 페이지나 섹션을 반환한다. 반환된 긴 문서는 질문 조건으로 Summarize(q, W(p))를 적용해 단축된 스니펫으로 변환하고, 이 스니펫들이 다음 상태의 관찰로 결합되어 이후의 행동 결정에 사용된다. 검색 도구는 호출 예산 B_img, B_text로 제한되며 각 호출 시 exclude_t로 현재까지 본 페이지 목록 P_t를 전달해 중복을 막고 P_{t+1}=P_t ∪ {p_i}로 갱신된다. 학습은 두 단계로 구성된다. 첫 단계는 리젝션 샘플링으로 초기 정책에서 여러 궤적을 샘플링한 뒤 규칙 기반 필터(도구 호출 형식 유효성, 실행 가능성, 최종 정답 여부)를 적용해 SFT 데이터셋을 구성해 지도학습을 수행한다. 두 번째 단계는 시퀀스 수준 RL로 TN-GSPO를 적용하며, 이때 생성 토큰 집합 T_gen만 그래디언트에 기여하도록 하고 도구에서 반환된 토큰 T_tool은 마스킹한다. TN-GSPO에서는 Δ_t = log πθ(y_t|s_t) − log π_ref(y_t|s_t)와 L(τ)=|T_gen|, H(τ)=1+#tool_calls를 정의하고 D(τ)=L(τ)(1+c·H(τ)^α)를 통해 정규화해 시퀀스 단위 비율 rθ(τ)=exp((1/D(τ))Σ_{t∈T_gen}Δ_t)를 계산해 중심화된 이점을 사용해 정책을 갱신한다. 또한 보상 설계는 정답 보상 r_ans, 형식 보상 r_fmt, 도구 비용 페널티 λ·C(τ)로 이루어져 예산 효율성과 형식 준수를 함께 유도한다.
관련 Figure

그림은 ProMSA가 추론 중 이미지 검색과 텍스트 검색을 선택하고 검색 결과를 요약해 다음 의사결정에 전달하는 점진적 루프 구조를 시각적으로 제시한다. 제외 목록과 중복 제거, 툴 예산이 에이전트 동작에 어떻게 영향을 미치는지 보여주어 고정된 RAG 파이프라인과의 차이를 명확히 한다. 이 다이어그램은 논문의 핵심 설계인 행동 토큰 기반 정책과 요약된 스니펫을 통한 상태 성장 제어를 연결해 이해하는 데 직접적 근거가 된다.
Figure 1은 직접 답변, RAG 기반, 제안된 ProMSA 에이전트의 동작을 비교하는 다이어그램이다.
주요 결과
주요 벤치마크에서 ProMSA는 E-VQA와 InfoSeek 모두에서 강력한 성능을 보였다. 예컨대 Qwen3-VL-8B 백본을 사용한 경우 E-VQA 전체(all)에서 52.6, InfoSeek 전체(all)에서 53.4의 성능을 보고했다. 이 수치는 기존의 RAG 기반 및 검색-에이전트 계열 강력한 베이스라인을 일관되게 상회했다. 학습 단계별 기여 분석에서는 Base→Cold-Start(SFT)→RL 순으로 성능이 크게 개선되었으며 표 2의 집계에 따르면 평균 정확도가 Base 35.1에서 Stage I 40.7로, Stage II 53.0으로 상승했다. 최적화 기법 비교에서 TN-GSPO는 GRPO·GSPO 계열보다 우수한 결과를 보였고 표 3에서 TN-GSPO가 E-VQA에서 52.6, InfoSeek에서 53.4를 달성해 다른 시퀀스 수준 방법보다 안정적 성능 개선을 확인했다. 도구 구성 및 예산에 관한 소거 실험에서 텍스트와 이미지 검색을 모두 사용할 때 성능이 가장 높았고(Table 4), Top-k와 도구 콜 예산을 조절하면 재현율과 노이즈 트레이드오프가 관찰되었다. 추가적으로 학습 동역학 시각화에서 TN-GSPO는 도구 호출 수를 급격히 줄이지 않고 합리적 범위에서 안정화해 탐색과 증거 수집의 균형을 유지했다.
관련 Figure

그래프는 RL 훈련 과정에서 TN-GSPO가 도구 호출 수를 급격히 줄이지 않으면서도 보상을 꾸준히 향상시키고 응답 길이를 안정화하는 경향을 보여준다. 또한 텍스트 검색과 이미지 검색의 비율 변화와 알고리즘별(tool-normalized vs 기존)의 호출 감소 속도 차이를 정량적으로 제시해 설계 선택의 효과를 실험적으로 입증한다. 이 시각화는 논문의 주장인 도구-호라이즌 정규화가 탐색-증거 수집 균형 유지에 기여함을 근거로 보강한다.
Figure 3은 툴 사용 비율, 툴 호출 수, 응답 길이, 학습 보상 등의 학습 동역학을 그래프로 제시한 결과이다.
기술 상세
전체 아키텍처는 단일 멀티모달 생성 정책 πθ를 중심으로 구성되며 정책 출력은 시퀀스화된 구조 y_t=(z_t, u_t, args_t)이다. z_t는 내부 추론 텍스트로 다음 행동 결정을 위한 컨텍스트로 사용되며 u_t은 img_search, text_search, stop 중 하나인 행동 토큰이고 args_t는 쿼리 재작성, top-k, 제외 목록 등 도구 인자를 포함한다. 검색 도구는 EVA-CLIP(이미지 리트리버)과 BGE(텍스트 리트리버)를 사용하고 각 호출은 Top-3 페이지나 섹션을 반환하며 반환 문서는 Qwen3-VL-8B 기반 요약기로 질문 조건의 요약 스니펫으로 압축된다. 학습에서는 먼저 리젝션 샘플링으로 SFT 데이터셋을 구성해 형식적 실행 가능성을 보장하고 그 다음 TN-GSPO로 시퀀스 수준 RL을 수행한다. TN-GSPO는 Δ_t, L(τ)=|T_gen|, H(τ)=1+#tool_calls을 정의하고 D(τ)=L(τ)(1+c·H(τ)^α)를 통해 전체 시퀀스의 로그 확률 차이를 정규화한 후 시퀀스 수준 비율 rθ(τ)=exp((1/D(τ))ΣΔ_t)를 사용해 클립된 목표를 최적화한다. 구현 세부사항으로는 SFT 학습률 1×10⁻⁵으로 3에폭, RL 단계 학습률 1×10⁻⁶ 전역 배치 128, asymmetric clipping(low=0.2, high=0.28), 각 궤적 최대 상호작용 T=7, 도구 비용 페널티 λ=0.5, c=0.04, α=1, 토큰 예산 궤적당 16384, 훈련 환경은 8×A800 GPU로 보고되었다.
관련 Figure

그림은 입력된 이미지와 질문에서 에이전트가 반복적으로 이미지 검색·텍스트 검색·정지 결정을 내리는 Progressive Search Loop를 보여주며 각 단계에서 요약 버퍼와 중복 제거 인덱스를 사용함을 나타낸다. 또한 리젝션 샘플링 SFT로 콜 형태를 학습하고 TN-GSPO로 시퀀스 수준 정책을 최적화하는 훈련 흐름을 병렬로 제시해 방법론의 전체 파이프라인과 학습 단계 간 역할 분담을 연결해 준다. 이 도식은 알고리즘 구현과 실험 설정에서 사용된 주요 하이퍼파라미터와 툴 호출 제약의 맥락을 이해하는 데 유용하다.
Figure 2는 ProMSA의 입력·루프·학습 파이프라인을 단계별로 정리한 개요 다이어그램이다.
한계점
추가적인 도구 호출 수 또는 더 큰 Top-k는 회수율을 높이지만 불필요한 노이즈를 함께 증가시켜 성능 향상에 한계와 경우에 따라 역효과를 초래할 수 있다. 도구 비용 제약은 학습 시 에이전트가 조기 중단을 선택하게 하여 일부 경우 잘못된 검색 결과에도 멈추는 행동을 유발할 수 있다. 긴꼬리 사례에서는 모델이 회수된 문서의 정합성을 완전히 확신하지 못해 일부 정답-정지 패턴이 비효율적으로 나타나는 한계가 보고되었다.
실무 활용
ProMSA 아키텍처는 외부 지식 기반에서 반복적으로 증거를 모아 추론하는 실제 KB-VQA 시스템에 적용 가능하다. 예산 제약과 중복 제거 메커니즘은 실시간 검색 비용을 통제하면서도 필요한 경우 추가 검색을 수행하도록 균형을 제공한다. 공개된 코드 저장소를 통해 연구자가 제시된 파이프라인과 TN-GSPO 학습 절차를 재현하고 자체 데이터셋에 맞춰 재학습할 수 있다.
- 백과사전 기반 이미지 질의응답 시스템에서 긴꼬리 엔티티를 다루는 고객 지원용 멀티모달 검색 파이프라인 통합
- 문화재·박물관 어플리케이션에서 촬영한 이미지의 실체 식별 후 세부 정보 보강을 위한 온디맨드 웹 기반 증거 탐색
- 멀티모달 리트리버와 결합한 대화형 에이전트에서 필요한 경우 추가 검색을 수행해 사실 기반 응답을 제공하는 워크플로
- 연구용 실험 플랫폼에서 도구 예산·Top-k·정규화 파라미터의 영향도를 평가하는 비교 실험
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- RAG
- — RAG는 외부 지식원에서 관련 문서를 검색하여 생성 모델의 입력으로 주입하는 방식이다. 이 방법은 사전학습된 파라메트릭 지식이 부족한 장문·장기기억 질문에 대해 검색한 증거를 기반으로 답변을 생성하게 한다. 고정된 top-k 설정은 회복성이나 다중 단계 증거 결합이 필요한 상황에서 한계를 보인다.
- Sequence-level RL
- — 시퀀스 수준 강화학습은 전체 생성 경로의 반환(Return)을 단위로 정책을 갱신하는 접근이다. 이 논문에서는 토큰 수준 보상 대신 전체 상호작용 궤적의 성공 여부와 도구 사용 비용을 결합해 보상을 산정한다. 길이 편향과 도구 상호작용 깊이를 정규화하는 것이 안정적 최적화에 중요하다.
- Deduplication
- — 중복 제거는 이미 회수된 페이지나 섹션을 배제해 동일한 증거가 반복 수집되는 것을 막는 절차이다. ProMSA는 검색 시 제외 목록(exclude)을 유지하고 새 후보를 기존 집합에 합치는 방식으로 중복을 제어한다. 이 처리는 잘못된 초기 검색이 증거 누적 편향으로 이어지는 것을 완화한다.
- Rejection-Sampling SFT
- — 리젝션 샘플링 SFT는 실행 가능한 도구 호출 형식을 배우기 위해 후보 궤적을 샘플링하고 규칙 필터로 유효한 궤적만 선별해 지도학습하는 방식이다. 이 과정은 RL 전 단계에서 정책이 실행가능한 행동을 생산하도록 보장해 초기 탐색의 불안정을 줄인다. 유효 궤적은 도구 형식, 실행 가능성, 정답 여부 기준으로 선택된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.