TL;DR
기업용 Text-to-SQL에서는 보안과 운영 통제를 위해 1B~9B 경량 모델을 사용하려는 수요가 있지만, 작은 모델은 SQL 실행 오류와 제한적인 Self-Correction 때문에 성능이 떨어집니다. LG AI연구원의 ReSQL은 실행 오류와 정답 쿼리로 구조화된 오류 추론 데이터를 만들고, 이를 LoRA 파인튜닝과 유사 오류 검색에 재사용하는 폐쇄 루프를 구성했습니다. 그 결과 Llama-3.2 1B의 BIRD 실행 정확도가 3.78%에서 24.84%로 상승했고, 7~9B 모델은 SPIDER 81.29%, BIRD 53.78%로 GPT-4 교정 기법을 앞섰습니다. 오류 추론 데이터는 BIRD 성능을 17.61%p 끌어올렸으며, 드문 Long-Tail Errors와 온디바이스 환경을 겨냥한 자기 개선 방식의 확장 가능성을 확인했습니다.
빠른 이해
새로운 점
모델이 생성한 SQL 오류를 구조화된 추론 데이터로 바꿔 재학습하고, 유사 오류 검색까지 연결한 자기 개선 폐쇄 루프입니다.
핵심 메커니즘
SQL 실행 실패에서 오류 메시지와 정답 쿼리를 입력으로 받아 오답 원인과 수정 방향을 추론 데이터로 생성하고, 이를 LoRA 파인튜닝에 사용한 뒤, 추론 단계에서 현재 오류와 유사한 과거 사례 3개를 검색해 수정 SQL 생성에 활용합니다.
핵심 수치
- Llama-3.2 1B BIRD 실행 정확도: 3.78% → 24.84%- 약 7배 향상
- Gemma-2 2B BIRD 실행 정확도: 13.36% → 26.92%- ReSQL 적용 전후
- CodeS-1B BIRD 실행 정확도: 22.23% → 34.94%- ReSQL 적용 전후
- 7~9B 모델 성능: SPIDER 81.29%, BIRD 53.78%- GPT-4 교정 기법은 SPIDER 79.98%, BIRD 49.87%
- SPIDER 평균 교정률: 64.38%- Extra Hard 쿼리 39.32%
- 추론 오버헤드: 평균 약 100토큰, 1.2초 미만- 실제 서비스 적용을 고려한 측정
섹션별 상세
기업 환경에서 드러난 Text-to-SQL의 한계
오류를 추론 데이터로 바꾸는 폐쇄 루프

1B부터 9B까지 확인된 성능 변화

검색 증강과 데이터 품질의 역할
오픈소스 공개와 다음 연구 방향
용어 해설
- 자연어-SQL 변환(Text-to-SQL)
- — 자연어 질문을 데이터베이스에서 실행할 수 있는 SQL 쿼리로 바꾸는 기술입니다. 모델은 질문과 데이터베이스 스키마를 입력받아 쿼리를 생성하고, 실행 결과가 의도한 답과 일치하는지로 품질을 평가받습니다. SQL 전문 지식 없이도 기업 데이터를 조회하게 하는 기반 기술입니다.
- 실행 정확도(Execution Accuracy)
- — 생성된 SQL을 실제 데이터베이스에서 실행한 결과가 정답 SQL의 실행 결과와 일치하는 비율입니다. SQL 문법이나 작성 방식이 서로 달라도 같은 결과를 반환하면 정답으로 계산합니다. Text-to-SQL 모델이 문장 형태가 아니라 실제 질의 목적을 달성했는지 측정하는 지표입니다.
- 장꼬리 오류(Long-Tail Errors)
- — 학습 데이터에서 자주 나타나지 않아 일반적인 파인튜닝만으로 해결하기 어려운 드문 오류 유형입니다. ReSQL은 과거 오류와 추론 과정을 저장한 뒤 현재 오류와 유사한 사례를 검색해 보완합니다. 빈도가 낮은 스키마·문법 조합에 대응하는 데 검색 증강의 가치가 커집니다.
- LoRA
- — 대규모 언어 모델의 전체 가중치를 갱신하지 않고 저순위 행렬을 추가 학습하는 파인튜닝 방식입니다. 원본 모델 대부분을 고정한 채 적은 수의 파라미터만 조정하므로 메모리와 학습 비용을 줄일 수 있습니다. ReSQL은 오류 추론 데이터를 원본 데이터와 합쳐 LoRA 방식으로 모델을 다시 학습시킵니다.
- Few-Shot 학습(Few-Shot)
- — 모델이 새로운 입력을 처리할 때 소수의 예시를 문맥으로 함께 제공받아 출력 방식을 추론하는 방법입니다. ReSQL은 현재 SQL 오류와 유사한 과거 오류-추론 사례 3개를 검색해 입력에 포함합니다. 모델이 드문 오류의 진단과 수정 방향을 기존 사례에서 참고하도록 만드는 방식입니다.
기술
- Text-to-SQL
- Large Language Model (LLM)
- Self-Correction
- LoRA
- Chain-of-Thought
- Retrieval-Augmented Generation (RAG)
- G-Eval
- SPIDER
- BIRD
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.