이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
Databricks가 합성 데이터 파이프라인을 활용해 약 120,000페이지 분량의 미국 재무 문서로 구성한 OfficeQA Pro V2 벤치마크를 공개했다. 벤치마크는 90문항으로 다문서 증거집합·표·차트 파싱과 시계열 보정 같은 기업형 근거 기반 추론 능력을 엄격히 시험한다. 동일 모델이라도 Databricks의 Genie 하니스와 ai_parse를 쓰면 평균 정확도가 수십 퍼센트포인트 오르고 비용도 낮아져, 하니스 설계가 성능·효율에 결정적 영향을 준다는 점이 핵심 시사점이다.
섹션별 상세
Databricks가 공개한 OfficeQA Pro V2는 기업형 근거 기반 추론을 평가하기 위한 새 벤치마크로, 약 1,400개의 U.S. Treasury PDF와 1793년부터 2024년까지의 대략 120,000페이지를 기반으로 90문항을 제공한다. 합성 데이터 기법을 도입해 다양한 시나리오와 검증 가능한 정답을 대규모로 생성했고, 이 데이터는 Grounded Reasoning Cup 대회에서 미지의 코퍼스에 대한 일반화 능력을 시험하는 데 쓰였다. 벤치마크 설계는 복잡한 표·차트 파싱, 다문서 증거집합, 시계열 보정 같은 기업형 과제를 재현하도록 구성되어 실무 전개와 직접적으로 연결된다.
근거
- OfficeQA Pro V2 코퍼스는 약 1,400개의 U.S. Treasury PDF와 대략 120,000페이지로 구성되며 기간은 1793년부터 2024년까지이다. — 벤치마크 구성 설명 및 'Spanning over Two Centuries' 절의 코퍼스 기술 부분.
벤치마크 확장에는 Databricks 내부의 합성 데이터 툴체인(asynth)과 4단계 파이프라인(Inputs→Synthesize→Verify→Review)이 사용되었다. 파이프라인은 시간대·분석법·출처수·토픽을 시드로 하여 합성 질문을 만들고, 합성 에이전트가 코퍼스에서 근거와 해답 후보를 추적한 뒤 독립 솔버와 검증 에이전트로 정답성·출처 충실성을 판별한다. 최종적으로는 인간 리뷰어가 모델 해답과 근거를 함께 교차확인하여 모호성이 없는 샘플만 벤치마크에 포함되도록 하여 자동화와 수동 검증을 결합했다.

근거
- 합성 데이터 파이프라인은 입력 시드, 합성 에이전트의 근거 추적, 독립 솔버에 의한 검증, 최종 수동 리뷰의 4단계로 운영된다. — Synthetic Data Pipeline 다이어그램과 해당 본문 절.
동일한 기저 모델이라도 에이전트 하니스에 따라 성능과 비용이 크게 달라진다는 점이 핵심 결과로 제시되었다. 모델 공급자 기본 하니스(Claude Code, Codex 등)로는 평균 정확도 26.0%에 그쳤으나, Databricks의 Genie 하니스로 매칭된 모델 간 비교에서는 평균 24.0 퍼센트포인트(상대 92%) 상승을 보였고, 네 모델 매칭 비교에서는 평균이 15.3 퍼센트포인트(37.5%→52.8%) 향상했다. 이 수치는 문서 파싱 방식(ai_parse 사용)과 증거 식별 과정의 설계가 같은 모델에서 대규모 성능 향상을 이끌 수 있음을 구체적으로 보여준다.

근거
- Databricks Genie는 동일 기저 모델을 사용할 때 모델 공급자 기본 하니스 대비 평균 정확도를 24.0 퍼센트포인트 향상시켰다(상대 개선 92%). — Agent 성능 비교 그래프와 본문 성능 서술(Genie vs provider harnesses) 부분. 그림: Agent Performance on OfficeQA Pro V2.
비용-품질 관점에서는 Genie 기반 구성들이 파레토 전선을 지배했으며, 특정 모델(예: Claude Fable 5)은 Genie로 전환하면 정확도가 상승하면서도 롤아웃 비용이 크게 낮아지는 사례가 관찰되었다. 분석 추적에서는 Fable 5가 문서 파싱 루프에 취약해 평균 롤아웃 비용이 $37.36까지 치솟았고, ai_parse를 통한 사전 파싱이 올바른 페이지·셀에 빠르게 접근하게 해 비용을 줄인 사례가 보고되었다. 따라서 문서 전처리·파싱 효율화가 고비용 모델의 실용성을 바꿀 수 있다는 실증적 근거가 확보되었다.

OfficeQA Pro V2는 원자료의 역사적·형식적 변화를 벤치마크 난이도의 핵심 요인으로 취급한다; 1790년대의 long s 같은 고어 타이포그래피·광폭 접이표·표 형식 변화·회계 관행의 진화가 자동 파싱에 추가적인 실패 모드를 만든다. 코퍼스 전반에 같은 개념이 명칭·단위·표 스키마·집계 수준에서 일관되게 나타나지 않으므로, 단순 텍스트 검색을 넘어 표 구조 재구성·단위 정규화·시계열 리콘실리에이션 같은 후처리 단계가 필요하다. 이 점이 OfficeQA Pro V2가 기존 OfficeQA보다 문서 횡단 일반화 능력을 더 엄격하게 시험하는 이유이다.


근거
- OfficeQA Pro V2는 총 90문항으로 이루어지며 질문당 평균 6.7개의 출처가 필요하고 74.4% 문항이 네 개 이상의 출처를 요구한다. — 벤치마크 세부 항목 표와 본문 'Benchmark Details' 수치.
결론적으로 세 가지 시사점이 도출된다: 대표성 있는 평가가 필수이며 합성 데이터는 규모와 다양성을 확보하는 현실적 수단이고, 하니스 설계는 같은 모델에서 성능·비용을 동시에 바꿀 수 있는 결정적 요소이며, 근거 기반 추론 분야는 문서 파싱·검증·시계열 보정 등 에이전트 스택 전반의 추가 혁신 여지가 크다. Databricks는 OfficeQA Pro V2와 파싱된 코퍼스를 Hugging Face에 공개했으며, 연구자·실무자가 자신들 시스템의 일반화 능력과 비용-정확도 균형을 테스트하는 데 이 벤치마크를 권장한다.
용어 해설
- 근거 기반 추론(Grounded reasoning)
- — 근거 기반 추론은 문서 내 출처를 찾아 그 정보를 입력으로 삼아 논리적·계산적 절차를 거쳐 결론을 도출하는 작업이다. 입력으로는 여러 문서의 표·차트·문장들이 들어오고 모델은 검색·파싱·집계·수치적 추정 과정을 거쳐 출력값을 만든다. 기업 환경에서는 문서 형식·표기법 변화와 시계열 보정 문제 때문에 동일한 개념을 일관되게 추론하는 능력이 중요하다.
- 합성 데이터 파이프라인(Synthetic data pipeline)
- — 합성 데이터 파이프라인은 실제 코퍼스에서 자동화된 규칙과 모델을 이용해 질문·정답 샘플을 생성하고 검증까지 거쳐 벤치마크를 확장하는 절차다. 입력(seed)로 시간대·분석방법·토픽·검색 범위 등을 무작위화하고, 생성 에이전트가 증거를 찾아 근거 추적(chain-of-evidence)을 남긴다. 독립 솔버와 검증단계, 최종 수동 심사를 통해 출처 충실성·정답 가능성을 확보한다.
- 에이전트 하니스(Agent harness)
- — 에이전트 하니스는 모델 호출·문서 파싱·검색·툴 오케스트레이션을 연결하는 실행 인프라스트럭처로 정의된다. 하니스 설계에 따라 동일한 기저 모델이 문서 접근성, 증거 식별 효율, 비용에 크게 다른 성능을 낸다. OfficeQA Pro V2 결과는 하니스 최적화가 정확도와 비용 모두에 결정적 영향을 미친다는 점을 보여준다.
- 파레토 전선(Pareto frontier)
- — 파레토 전선은 비용과 품질 같은 두 축에서 어느 쪽도 더 나아지기 위해서는 다른 쪽을 포기해야 하는 지점들을 연결한 곡선이다. OfficeQA Pro V2 실험에서는 Databricks Genie를 쓴 구성들이 비용을 낮추면서 정확도를 올려 파레토 전선 상위에 위치했다. 따라서 같은 모델이라도 하니스 변경으로 파레토 효율을 바꿀 수 있다는 평가 기준이 된다.
- 증거 검색(Retrieval)
- — 증거 검색은 질문과 관련된 페이지·표·문단을 코퍼스에서 찾아오는 단계이며, 검색 키워드 생성·유사도 순위·문서 내 위치 추적을 포함한다. OfficeQA Pro V2에서는 질문당 평균 6.7개 출처가 필요해 검색 범위와 응집성 유지가 성능 결정 요인이 된다. 검색 실패는 이후 파싱·추론 단계 전체를 무력화하는 주요 실패 모드다.
기술
- Databricks Genie
- ai_parse
- Claude Opus 4.8
- Claude Fable 5
- GPT-5.5
- GPT-5.6 Sol
- GPT-5.6 Luna
- GPT-5.6 Terra
활용 사례
- 기업 재무·규정 문서 코퍼스에서의 근거 기반 질의응답 성능 비교
- 에이전트 하니스 설계가 비용-정확도에 미치는 영향 평가
- 문서 파싱·검증 모듈의 실패 모드 식별과 개선 전후 성능 측정
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 06.수집 2026. 08. 06.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
