TL;DR
BEAVER는 실제 기업 환경의 데이터를 기반으로 구축된 대규모 Text-to-SQL 벤치마크 데이터셋이다. 19개 도메인과 812개 테이블에 걸쳐 총 9,128개의 쿼리를 포함하며, 이 중 7,978개가 공개되었다. 단순 쿼리부터 도메인 지식이 요구되는 복잡한 쿼리까지 다양한 유형을 다룬다. 다중 테이블 검색, 조인 키 탐지, 컬럼 매핑 등 5가지 하위 작업에 대한 세밀한 평가를 지원한다.
대상 독자
Text-to-SQL 모델 연구자 및 기업 데이터 분석 시스템 개발자
의미 / 영향
기업 환경의 복잡한 데이터 구조를 반영한 벤치마크로서, 실제 비즈니스 도메인에서 LLM 기반 SQL 생성 모델의 실효성을 검증하는 데 기여한다.
섹션별 상세
- BEAVER는 9,128개의 쿼리를 포함하며 19개 도메인과 812개 테이블을 다룬다. — BEAVER is a large-scale enterprise text-to-SQL dataset containing 9128 queries spanning 812 tables across 19 diverse domains.
용어 해설
- Text-to-SQL
- — 자연어 질의를 데이터베이스 쿼리인 SQL로 변환하는 기술. 데이터베이스 스키마와 질문을 입력받아 정확한 SQL을 생성하는 것이 핵심이며, 기업 데이터 분석 자동화의 필수 요소이다.
- Benchmark
- — 모델의 성능을 객관적으로 측정하기 위한 표준화된 데이터셋과 평가 지표. 특정 도메인에서의 모델 강점과 약점을 파악하는 데 사용된다.
- Query Decomposition
- — 복잡한 자연어 질문을 처리 가능한 여러 개의 단순한 하위 질의로 나누는 과정. 다중 테이블 조인이 필요한 복잡한 SQL 생성 시 모델의 정확도를 높이는 데 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

