이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
기업 문서의 차트는 중요한 수치와 레이블을 포함하지만 이미지 설명만 인덱싱하는 RAG 시스템에서는 세부 질의에 필요한 정보가 검색되지 않는 문제가 있습니다. Databricks는 ai_parse_document로 차트를 설명과 구조화된 chart JSON으로 추출하고 ai_prep_search와 ai_search를 거쳐 Genie가 답변하는 pipeline을 구성했습니다. 300M-parameter text embedding model을 사용한 JSON-enriched 구성은 ViDoRe V3에서 73.3%, Chart-RAG에서 71.1%의 답변 정확도를 냈고 상위 3개 이미지를 추가하면 각각 75.9%와 75.1%로 높아졌습니다. 이 구성은 대형 멀티모달 embedding baseline보다 높은 답변 정확도를 보이면서 차트 수치를 검색 인덱스에 직접 넣고 필요한 시각적 맥락만 추가하는 방식으로 인덱싱·검색 부담과 이미지 입력량을 줄입니다.
섹션별 상세
기업 문서의 핵심 정보가 차트와 그림 안에 들어가면서 검색 에이전트가 값의 비교나 개수 세기 같은 질의에 취약해졌습니다. 이미지 설명만 인덱싱하면 차트의 주제는 찾더라도 세부 수치가 검색 공간에 들어오지 않아 틀린 페이지를 가져오거나 정답 페이지를 가져와도 답변 근거가 부족해집니다. Databricks는 차트를 에이전트가 검색하고 추론할 수 있는 구조로 바꾸는 문제를 차트 JSON enrichment로 해결하려 했습니다.



Databricks의 chart-aware retrieval pipeline은 PDF를 ai_parse_document로 처리해 차트 설명과 구조화된 chart JSON을 추출하고, ai_prep_search로 검색용 chunk를 만든 뒤 300M-parameter text embedding model로 인덱싱합니다. ai_search가 관련 chunk를 검색하고 Genie가 그 결과를 바탕으로 답변을 생성하는 입력·처리·출력 흐름입니다. 차트 이미지는 필요할 때 검색된 상위 3개 이미지로 추가해 시각적 형태에 의존하는 질의까지 보완합니다.


평가는 차트와 infographic 중심의 ViDoRe V3 310개 질의와 BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions에서 만든 114개 질의의 Chart-RAG 데이터셋으로 진행됐습니다. description-only 인덱스와 설명·chart JSON을 함께 넣은 JSON-enriched 인덱스를 같은 300M-parameter BGE text embedding model로 비교하고, 답변은 Correct·Partially Correct·Incorrect로 세 번 반복 채점했습니다. 검색은 Hit Rate@10과 nDCG@10으로, 답변은 LLM judge인 gemini-3-flash로 평가했습니다.





구조화된 chart JSON은 두 데이터셋에서 검색 품질과 답변 정확도를 함께 높였습니다. JSON에 상위 3개 이미지를 더한 구성은 ViDoRe V3에서 75.9%, Chart-RAG에서 75.1%의 정답률을 기록해 ColQwen2.5-3B, Qwen3-VL-Embedding-2B, Jina CLIP v2, CLIP ViT-L/14보다 높았고, 이미지 입력은 JSON만 사용한 구성보다 각각 2.6 percentage points와 4 percentage points를 추가했습니다. 그 결과 차트 내용을 별도의 대형 멀티모달 임베딩 구조로 처리하지 않고도 더 작은 이미지 예산과 낮은 인덱싱·검색 부담으로 경쟁력 있는 답변 품질을 확보했습니다.


차트 JSON은 단순히 답변에 수치를 제공하는 데 그치지 않고 차트의 값과 레이블을 검색 인덱스에 넣어 해당 페이지 자체의 검색 가능성을 높입니다. 예를 들어 Oil VIX가 Q1 2026에 약 80 percentage points까지 올랐는지 묻는 질의는 description-only 구성에서 정확한 정보를 찾지 못했지만, chart-JSON enriched 구성에서는 약 80 percentage points라는 답을 얻었습니다. Databricks는 향후 ai_parse_document에서 차트 값을 자동으로 구조화된 텍스트로 포함하고, ai_prep_search와 함께 PDF 기반 Genie 답변에 적용할 계획입니다.
용어 해설
- 차트 JSON(Chart JSON)
- — 차트의 제목과 설명뿐 아니라 각 막대·선·축의 값과 레이블을 구조화된 JSON으로 표현하는 방식입니다. 검색 인덱스에 수치 정보를 직접 넣어 숫자 질의의 검색·추론 근거로 활용합니다. 차트 이미지를 다시 읽지 않아도 세부 값을 찾을 수 있다는 점이 중요합니다.
- Hit Rate@10
- — 검색 결과 상위 10개 안에 정답 페이지가 하나 이상 포함됐는지 측정하는 검색 평가 지표입니다. ViDoRe V3에서는 관련도 점수가 1 또는 2인 페이지를 모두 적중으로 처리하고, Chart-RAG에서는 각 질의의 정답 페이지 하나를 기준으로 계산합니다. 정답 문서가 검색됐는지 직관적으로 파악하는 데 쓰입니다.
- nDCG@10
- — 상위 10개 검색 결과에서 정답 페이지가 얼마나 높은 순위에 배치됐는지 관련도 등급을 반영해 측정하는 지표입니다. Hit Rate@10과 달리 정답의 존재 여부뿐 아니라 순위와 graded relevance를 함께 반영합니다. 검색된 페이지가 답변 생성에 얼마나 유리한 위치에 놓였는지 평가하는 데 중요합니다.
- 멀티모달 Embedding Model(Multimodal Embedding Model)
- — 텍스트와 이미지처럼 서로 다른 형식의 정보를 벡터로 변환해 질의와 문서의 유사도를 계산하는 모델입니다. 이 글에서는 페이지 전체를 임베딩한 뒤 cosine similarity 또는 MaxSim으로 검색 결과를 정렬합니다. 구조화된 차트 JSON과 경량 text embedding 조합의 성능을 비교하는 기준으로 사용됩니다.
- Late-Interaction
- — 문서와 질의를 하나의 벡터로 합치지 않고 여러 벡터를 유지한 채 검색 시 세부 토큰 또는 영역 간 유사도를 계산하는 방식입니다. ColQwen2.5-3B는 이 구조와 MaxSim 점수를 사용해 페이지를 정렬합니다. 검색 표현력이 높은 대신 다중 벡터 저장과 검색에 더 큰 비용이 필요합니다.
기술
- ai_parse_document
- ai_prep_search
- ai_search
- Genie
- Databricks AI functions
- BGE text embedding model
- ColQwen2.5-3B
- Qwen3-VL-Embedding-2B
- Jina CLIP v2
- CLIP ViT-L/14
- gemini-3-flash
활용 사례
- 기업 PDF의 차트 기반 질의응답
- 금융 서비스 문서 검색
- 차트와 infographic이 포함된 보고서 검색
- 차트 수치와 추세를 묻는 retrieval agent
- Genie를 활용한 PDF 질의응답
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.