본문으로 건너뛰기

차트 JSON으로 검색 에이전트의 수치 추론 강화

구조화된 chart JSON이 차트 검색과 에이전트 답변 정확도를 함께 높입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기업 문서의 차트는 중요한 수치와 레이블을 포함하지만 이미지 설명만 인덱싱하는 RAG 시스템에서는 세부 질의에 필요한 정보가 검색되지 않는 문제가 있습니다. Databricks는 ai_parse_document로 차트를 설명과 구조화된 chart JSON으로 추출하고 ai_prep_search와 ai_search를 거쳐 Genie가 답변하는 pipeline을 구성했습니다. 300M-parameter text embedding model을 사용한 JSON-enriched 구성은 ViDoRe V3에서 73.3%, Chart-RAG에서 71.1%의 답변 정확도를 냈고 상위 3개 이미지를 추가하면 각각 75.9%와 75.1%로 높아졌습니다. 이 구성은 대형 멀티모달 embedding baseline보다 높은 답변 정확도를 보이면서 차트 수치를 검색 인덱스에 직접 넣고 필요한 시각적 맥락만 추가하는 방식으로 인덱싱·검색 부담과 이미지 입력량을 줄입니다.

섹션별 상세

01
기업 문서의 핵심 정보가 차트와 그림 안에 들어가면서 검색 에이전트가 값의 비교나 개수 세기 같은 질의에 취약해졌습니다. 이미지 설명만 인덱싱하면 차트의 주제는 찾더라도 세부 수치가 검색 공간에 들어오지 않아 틀린 페이지를 가져오거나 정답 페이지를 가져와도 답변 근거가 부족해집니다. Databricks는 차트를 에이전트가 검색하고 추론할 수 있는 구조로 바꾸는 문제를 차트 JSON enrichment로 해결하려 했습니다.
1898년부터 1990년까지 미국의 GNP 대비 총저축률 변화를 나타낸 선형 차트입니다.
Chart차트에는 1930년대 대공황과 제2차 세계대전 시기에 저축률이 크게 하락했다가 반등하는 흐름이 나타납니다. 이 이미지는 에이전트가 선의 국소 최대값을 세는 질의에서 구조화된 차트 데이터가 필요한 이유를 직접 보여주는 예시입니다.
차트 이미지만 입력받은 frontier agent가 국소 최대값 개수를 17개로 답한 화면입니다.
Screenshot화면에는 에이전트가 50초 동안 추론했지만 차트의 점을 잘못 세어 17개라고 답한 결과가 나타납니다. 이미지 자체만 제공하는 방식이 차트의 수치와 패턴을 세밀하게 처리하는 데 취약하다는 글의 동기를 뒷받침합니다.
차트에서 국소 최대값을 18개로 세어 정답을 낸 Genie의 응답 화면입니다.
ScreenshotGenie는 차트 이미지 대신 ai_parse_document가 추출한 구조화된 차트 표현을 사용해 정답 18개를 제시합니다. 같은 질의에서 구조화된 값과 레이블을 검색·추론 입력으로 제공하는 방식이 이미지 단독 입력보다 정확한 결과를 낸 사례입니다.
02
Databricks의 chart-aware retrieval pipeline은 PDF를 ai_parse_document로 처리해 차트 설명과 구조화된 chart JSON을 추출하고, ai_prep_search로 검색용 chunk를 만든 뒤 300M-parameter text embedding model로 인덱싱합니다. ai_search가 관련 chunk를 검색하고 Genie가 그 결과를 바탕으로 답변을 생성하는 입력·처리·출력 흐름입니다. 차트 이미지는 필요할 때 검색된 상위 3개 이미지로 추가해 시각적 형태에 의존하는 질의까지 보완합니다.
Source PDFs에서 차트 JSON 추출, 검색 chunk 생성, 인덱싱, Genie 답변으로 이어지는 chart-aware retrieval pipeline입니다.
DiagramSource PDFs의 텍스트·표·차트를 ai_parse_document가 구조화된 chart JSON과 함께 추출하고, ai_prep_search가 enriched chunk를 만든 뒤 ai_search가 임베딩과 인덱싱을 수행합니다. 검색된 chunk와 선택적 상위 차트 이미지가 Genie의 답변 생성 입력으로 전달됩니다.
2026년과 2027년 GDP growth 및 headline inflation을 여러 전망 시나리오별로 비교한 grouped bar chart입니다.
Chart차트는 January 2026 WEO Update forecast, Preconflict WEO forecast, April 2026 WEO reference forecast, Adverse scenario, Severe scenario를 색상별 막대로 비교합니다. 실제 수치와 시나리오 레이블이 함께 있어 차트 구조를 JSON으로 보존하면 검색과 질의응답에 활용할 수 있는 정보를 보여줍니다.
03
평가는 차트와 infographic 중심의 ViDoRe V3 310개 질의와 BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions에서 만든 114개 질의의 Chart-RAG 데이터셋으로 진행됐습니다. description-only 인덱스와 설명·chart JSON을 함께 넣은 JSON-enriched 인덱스를 같은 300M-parameter BGE text embedding model로 비교하고, 답변은 Correct·Partially Correct·Incorrect로 세 번 반복 채점했습니다. 검색은 Hit Rate@10과 nDCG@10으로, 답변은 LLM judge인 gemini-3-flash로 평가했습니다.
ViDoRe V3와 Chart-RAG에서 description-only, chart JSON enrichment, 멀티모달 embedding 구성을 비교한 답변 정확도 막대그래프입니다.
ChartViDoRe V3에서는 description-only 65.2%, chart JSON과 상위 3개 이미지 75.9%, 멀티모달 embedding 74.3%가 나타납니다. Chart-RAG에서는 각각 18.4%, 75.1%, 71.4%로, chart JSON 기반 구성이 두 데이터셋에서 가장 높은 정확도를 기록합니다.
ViDoRe V3와 Chart-RAG에서 Correct answers, Hit@10, nDCG@10을 description-only와 Chart-JSON enriched로 비교한 점 그래프입니다.
ChartViDoRe V3에서 Correct answers는 65.2%에서 73.3%로, Hit@10은 84.0%에서 85.3%로, nDCG@10은 48.7%에서 51.6%로 상승합니다. Chart-RAG에서는 Correct answers가 18.4%에서 71.1%, Hit@10이 90.6%에서 96.5%, nDCG@10이 78.8%에서 94.4%로 개선됩니다.
차트 JSON을 추가했을 때 기존 오답이 정답으로 바뀐 비율과 그중 검색·순위가 개선된 비율을 보여주는 비교 도표입니다.
ChartViDoRe V3에서는 전체 질의의 9.3%가 Incorrect에서 Correct로 바뀌었고, 수정된 답변 중 27.5%는 Hit@10, 63.1%는 nDCG@10도 개선됐습니다. Chart-RAG에서는 정답 전환 비율이 57.8%였으며, 수정된 답변 중 Hit@10 개선은 6.1%, nDCG@10 개선은 27.8%로 나타납니다.
2025년 1분기부터 2026년 1분기까지 dispersion index, Oil VIX, VIX의 변동성을 나타낸 시계열 차트입니다.
ChartOil VIX는 2026년 1분기 무렵 80 percentage points 부근까지 급등하고, dispersion index와 VIX도 같은 기간의 변동을 함께 나타냅니다. 본문에서 Oil VIX의 최고점을 묻는 질의에 chart JSON이 약 80 percentage points라는 답을 제공한 사례와 연결됩니다.
ViDoRe V3와 Chart-RAG에서 Chart-JSON enriched와 상위 3개 검색 이미지를 추가한 구성의 정확도를 비교한 막대그래프입니다.
ChartViDoRe V3의 정확도는 Chart-JSON enriched 73.3%에서 상위 3개 이미지 추가 후 75.9%로, Chart-RAG는 71.1%에서 75.1%로 높아집니다. 검색 결과는 그대로 유지한 채 답변 시 시각적 맥락만 추가해도 정확도가 개선된다는 점을 나타냅니다.
04
구조화된 chart JSON은 두 데이터셋에서 검색 품질과 답변 정확도를 함께 높였습니다. JSON에 상위 3개 이미지를 더한 구성은 ViDoRe V3에서 75.9%, Chart-RAG에서 75.1%의 정답률을 기록해 ColQwen2.5-3B, Qwen3-VL-Embedding-2B, Jina CLIP v2, CLIP ViT-L/14보다 높았고, 이미지 입력은 JSON만 사용한 구성보다 각각 2.6 percentage points와 4 percentage points를 추가했습니다. 그 결과 차트 내용을 별도의 대형 멀티모달 임베딩 구조로 처리하지 않고도 더 작은 이미지 예산과 낮은 인덱싱·검색 부담으로 경쟁력 있는 답변 품질을 확보했습니다.
Qwen3-VL-Embedding-2B, ColQwen2.5-3B, Jina CLIP v2, CLIP ViT-L/14와 chart JSON 및 상위 3개 이미지 구성의 retrieval quality와 answer quality를 비교한 산점도입니다.
Chart가로축은 nDCG@10 기반 retrieval quality, 세로축은 correct answers이며, chart JSON과 상위 3개 이미지 구성은 약 52% retrieval quality와 77% answer quality 부근에 위치합니다. Qwen3-VL-Embedding-2B와 ColQwen2.5-3B는 더 높은 retrieval quality를 보이지만, chart JSON 구성은 더 작은 이미지 예산으로 유사한 답변 품질을 겨냥합니다.
멀티모달 embedding 모델과 chart JSON 및 상위 3개 이미지 구성의 retrieval quality와 answer quality를 넓은 축 범위에서 비교한 산점도입니다.
Chartchart JSON과 상위 3개 이미지 구성은 retrieval quality 약 94%와 answer quality 약 75%에 위치하며, Qwen3-VL-Embedding-2B와 ColQwen2.5-3B는 각각 약 86%·70%, 약 97%·72% 수준으로 표시됩니다. Jina CLIP v2와 CLIP ViT-L/14는 두 지표 모두 더 낮은 위치에 있어 모델별 검색·답변 품질 차이를 비교할 수 있습니다.
05
차트 JSON은 단순히 답변에 수치를 제공하는 데 그치지 않고 차트의 값과 레이블을 검색 인덱스에 넣어 해당 페이지 자체의 검색 가능성을 높입니다. 예를 들어 Oil VIX가 Q1 2026에 약 80 percentage points까지 올랐는지 묻는 질의는 description-only 구성에서 정확한 정보를 찾지 못했지만, chart-JSON enriched 구성에서는 약 80 percentage points라는 답을 얻었습니다. Databricks는 향후 ai_parse_document에서 차트 값을 자동으로 구조화된 텍스트로 포함하고, ai_prep_search와 함께 PDF 기반 Genie 답변에 적용할 계획입니다.

용어 해설

차트 JSON(Chart JSON)
차트의 제목과 설명뿐 아니라 각 막대·선·축의 값과 레이블을 구조화된 JSON으로 표현하는 방식입니다. 검색 인덱스에 수치 정보를 직접 넣어 숫자 질의의 검색·추론 근거로 활용합니다. 차트 이미지를 다시 읽지 않아도 세부 값을 찾을 수 있다는 점이 중요합니다.
Hit Rate@10
검색 결과 상위 10개 안에 정답 페이지가 하나 이상 포함됐는지 측정하는 검색 평가 지표입니다. ViDoRe V3에서는 관련도 점수가 1 또는 2인 페이지를 모두 적중으로 처리하고, Chart-RAG에서는 각 질의의 정답 페이지 하나를 기준으로 계산합니다. 정답 문서가 검색됐는지 직관적으로 파악하는 데 쓰입니다.
nDCG@10
상위 10개 검색 결과에서 정답 페이지가 얼마나 높은 순위에 배치됐는지 관련도 등급을 반영해 측정하는 지표입니다. Hit Rate@10과 달리 정답의 존재 여부뿐 아니라 순위와 graded relevance를 함께 반영합니다. 검색된 페이지가 답변 생성에 얼마나 유리한 위치에 놓였는지 평가하는 데 중요합니다.
멀티모달 Embedding Model(Multimodal Embedding Model)
텍스트와 이미지처럼 서로 다른 형식의 정보를 벡터로 변환해 질의와 문서의 유사도를 계산하는 모델입니다. 이 글에서는 페이지 전체를 임베딩한 뒤 cosine similarity 또는 MaxSim으로 검색 결과를 정렬합니다. 구조화된 차트 JSON과 경량 text embedding 조합의 성능을 비교하는 기준으로 사용됩니다.
Late-Interaction
문서와 질의를 하나의 벡터로 합치지 않고 여러 벡터를 유지한 채 검색 시 세부 토큰 또는 영역 간 유사도를 계산하는 방식입니다. ColQwen2.5-3B는 이 구조와 MaxSim 점수를 사용해 페이지를 정렬합니다. 검색 표현력이 높은 대신 다중 벡터 저장과 검색에 더 큰 비용이 필요합니다.

기술

  • ai_parse_document
  • ai_prep_search
  • ai_search
  • Genie
  • Databricks AI functions
  • BGE text embedding model
  • ColQwen2.5-3B
  • Qwen3-VL-Embedding-2B
  • Jina CLIP v2
  • CLIP ViT-L/14
  • gemini-3-flash

활용 사례

  • 기업 PDF의 차트 기반 질의응답
  • 금융 서비스 문서 검색
  • 차트와 infographic이 포함된 보고서 검색
  • 차트 수치와 추세를 묻는 retrieval agent
  • Genie를 활용한 PDF 질의응답
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.