용어 해설
- 그룹 상대 정책 최적화(GRPO)
- — GRPO는 학습을 수행하지 않고도 여러 후보 응답을 그룹 단위로 비교하여 신뢰성 지표가 높은 출력을 선택하는 훈련-프리 선택 메커니즘이다. 각 후보 궤적에서 링크 유효성, 주장-증거 커버리지, 중립성 등을 경량 검증기에 의해 평가하고 집단 상대 점수로 최종 출력을 고른다. 이 방식은 VLM 본체를 업데이트하지 않으면서 응답 신뢰도를 높이는 데 중요하다.
- 딥리서치 스타일 지식 획득(DeepResearch)
- — DeepResearch는 에이전트가 질의를 하위 과제로 분해하고 반복적 검색-수집-합성을 수행해 증거를 모으는 계획 기반 도구 루프이다. 이 방식은 단회 검색보다 반복적으로 검색 질의를 개선하고 더 풍부한 증거 풀을 구성할 수 있게 한다. VaseMuseum에서는 시각 단서가 부족할 때 외부 근거를 얻기 위해 해당 루프를 활용하였다.
- 출처 제어(Source Control)
- — Source Control은 검색 결과에 대해 접근성, 텍스트 충분도, 도메인 우선도 등을 계산해 유효성 필터링과 다양성 기반 선택을 수행하는 전처리 계층이다. 유효도 s_val와 사전-다양성 점수 phi_pre를 통해 낮은 품질의 링크를 제거하고 최대 N_src 개의 대표적 증거를 선택한다. 이 계층은 잘못된 인용과 중복 증거 유입을 줄여 생성 단계의 근거 오염을 낮춘다.
- 응답 제어(Response Control)
- — Response Control은 초안 응답을 개별 주장 단위로 분해하고 각 주장에 대해 증거 커버리지를 계산해 응답 신뢰도 점수 ψ를 산출하는 후처리 계층이다. ψ는 주장 커버리지, 일관성, 다중 근거 지원 비율, 충돌 패널티를 가중 합산하여 결정되며 임계값 τ_conf 미만이면 불확실 모드로 전환한다. 이 메커니즘은 근거가 부족하거나 상충할 때 증거 기반의 겸허한 답변을 도출하는 역할을 한다.
코드 예제
1: Input: query q, observation I, VLM M, rounds R_max
2: Output: answer a
3: D <- (q, I); E <- ∅; a_tilde <- ∅
4: for t = 1 to R_max do
5: Sample m_t ~ M(D); append m_t to D
6: if m_t contains no tool request then
7: a_tilde <- m_t; break
8: end if
9: for each tool request in m_t do
10: Execute tool and obtain payload y
11: E_t <- SourceControl(q, y)
12: E <- Merge(E, E_t)
13: Append E_t to D
14: end for
15: end for
16: if a_tilde = ∅ then
17: Generate final draft a_tilde ~ M(D)
18: end if
19: g <- ResponseControl(q, a_tilde, E)
20: a <- Calibrate(a_tilde, g)
21: return a이 의사코드는 VaseAgent의 온라인 추론 절차를 나타낸다. 입력으로 질의와 관찰을 받은 뒤 VLM과의 상호작용으로 도구 호출을 수행하고 각 도구 반환물은 Source Control 단계에서 검증되어 증거 풀에 합쳐진다. 최종 초안은 Response Control로 감사되어 보정되며 보정 결과가 출력으로 선택된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





