본문으로 건너뛰기

VaseMuseum: 고대 그리스 도기용 지능형 디지털 박물관

VaseMuseum은 시각 기반 추론과 반복적 외부 검색을 결합하고 출처·응답 제어와 훈련-프리 GRPO 선택을 통해 도자기 관련 질의에 대해 근거 기반이고 불확실성 보정된 답변을 제공한다.

용어 해설

그룹 상대 정책 최적화(GRPO)
GRPO는 학습을 수행하지 않고도 여러 후보 응답을 그룹 단위로 비교하여 신뢰성 지표가 높은 출력을 선택하는 훈련-프리 선택 메커니즘이다. 각 후보 궤적에서 링크 유효성, 주장-증거 커버리지, 중립성 등을 경량 검증기에 의해 평가하고 집단 상대 점수로 최종 출력을 고른다. 이 방식은 VLM 본체를 업데이트하지 않으면서 응답 신뢰도를 높이는 데 중요하다.
딥리서치 스타일 지식 획득(DeepResearch)
DeepResearch는 에이전트가 질의를 하위 과제로 분해하고 반복적 검색-수집-합성을 수행해 증거를 모으는 계획 기반 도구 루프이다. 이 방식은 단회 검색보다 반복적으로 검색 질의를 개선하고 더 풍부한 증거 풀을 구성할 수 있게 한다. VaseMuseum에서는 시각 단서가 부족할 때 외부 근거를 얻기 위해 해당 루프를 활용하였다.
출처 제어(Source Control)
Source Control은 검색 결과에 대해 접근성, 텍스트 충분도, 도메인 우선도 등을 계산해 유효성 필터링과 다양성 기반 선택을 수행하는 전처리 계층이다. 유효도 s_val와 사전-다양성 점수 phi_pre를 통해 낮은 품질의 링크를 제거하고 최대 N_src 개의 대표적 증거를 선택한다. 이 계층은 잘못된 인용과 중복 증거 유입을 줄여 생성 단계의 근거 오염을 낮춘다.
응답 제어(Response Control)
Response Control은 초안 응답을 개별 주장 단위로 분해하고 각 주장에 대해 증거 커버리지를 계산해 응답 신뢰도 점수 ψ를 산출하는 후처리 계층이다. ψ는 주장 커버리지, 일관성, 다중 근거 지원 비율, 충돌 패널티를 가중 합산하여 결정되며 임계값 τ_conf 미만이면 불확실 모드로 전환한다. 이 메커니즘은 근거가 부족하거나 상충할 때 증거 기반의 겸허한 답변을 도출하는 역할을 한다.

코드 예제

text
1: Input: query q, observation I, VLM M, rounds R_max
2: Output: answer a
3: D <- (q, I); E <- ∅; a_tilde <- ∅
4: for t = 1 to R_max do
5:   Sample m_t ~ M(D); append m_t to D
6:   if m_t contains no tool request then
7:     a_tilde <- m_t; break
8:   end if
9:   for each tool request in m_t do
10:    Execute tool and obtain payload y
11:    E_t <- SourceControl(q, y)
12:    E <- Merge(E, E_t)
13:    Append E_t to D
14:   end for
15: end for
16: if a_tilde = ∅ then
17:   Generate final draft a_tilde ~ M(D)
18: end if
19: g <- ResponseControl(q, a_tilde, E)
20: a <- Calibrate(a_tilde, g)
21: return a

이 의사코드는 VaseAgent의 온라인 추론 절차를 나타낸다. 입력으로 질의와 관찰을 받은 뒤 VLM과의 상호작용으로 도구 호출을 수행하고 각 도구 반환물은 Source Control 단계에서 검증되어 증거 풀에 합쳐진다. 최종 초안은 Response Control로 감사되어 보정되며 보정 결과가 출력으로 선택된다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.