본문으로 건너뛰기
LG AI Research조회 2

ReSQL로 SQL 오류를 학습하는 자기 개선 Text-to-SQL

ReSQL은 SQL 실행 오류를 추론 데이터로 바꿔 경량 Text-to-SQL 모델을 개선하고, 7~9B 모델에서 GPT-4 교정 기법을 넘어섰습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기업용 Text-to-SQL에서는 보안과 운영 통제를 위해 1B~9B 경량 모델을 사용하려는 수요가 있지만, 작은 모델은 SQL 실행 오류와 제한적인 Self-Correction 때문에 성능이 떨어집니다. LG AI연구원의 ReSQL은 실행 오류와 정답 쿼리로 구조화된 오류 추론 데이터를 만들고, 이를 LoRA 파인튜닝과 유사 오류 검색에 재사용하는 폐쇄 루프를 구성했습니다. 그 결과 Llama-3.2 1B의 BIRD 실행 정확도가 3.78%에서 24.84%로 상승했고, 7~9B 모델은 SPIDER 81.29%, BIRD 53.78%로 GPT-4 교정 기법을 앞섰습니다. 오류 추론 데이터는 BIRD 성능을 17.61%p 끌어올렸으며, 드문 Long-Tail Errors와 온디바이스 환경을 겨냥한 자기 개선 방식의 확장 가능성을 확인했습니다.

빠른 이해

새로운 점

모델이 생성한 SQL 오류를 구조화된 추론 데이터로 바꿔 재학습하고, 유사 오류 검색까지 연결한 자기 개선 폐쇄 루프입니다.

핵심 메커니즘

SQL 실행 실패에서 오류 메시지와 정답 쿼리를 입력으로 받아 오답 원인과 수정 방향을 추론 데이터로 생성하고, 이를 LoRA 파인튜닝에 사용한 뒤, 추론 단계에서 현재 오류와 유사한 과거 사례 3개를 검색해 수정 SQL 생성에 활용합니다.

핵심 수치

  • Llama-3.2 1B BIRD 실행 정확도: 3.78% → 24.84%- 약 7배 향상
  • Gemma-2 2B BIRD 실행 정확도: 13.36% → 26.92%- ReSQL 적용 전후
  • CodeS-1B BIRD 실행 정확도: 22.23% → 34.94%- ReSQL 적용 전후
  • 7~9B 모델 성능: SPIDER 81.29%, BIRD 53.78%- GPT-4 교정 기법은 SPIDER 79.98%, BIRD 49.87%
  • SPIDER 평균 교정률: 64.38%- Extra Hard 쿼리 39.32%
  • 추론 오버헤드: 평균 약 100토큰, 1.2초 미만- 실제 서비스 적용을 고려한 측정

섹션별 상세

01

기업 환경에서 드러난 Text-to-SQL의 한계

Text-to-SQL은 자연어만으로 복잡한 데이터베이스를 조회하게 하지만, 기업 환경에서는 보안·운영 통제와 경량 모델의 성능이 동시에 문제가 됩니다. 대기업은 데이터 주권, 규제 준수, 비용 예측 가능성, 외부 플랫폼 종속성, 모델 통제권을 이유로 자체 모델을 검토하며, 온디바이스와 엣지 환경에서는 1B~9B 규모의 경량 오픈소스 모델이 현실적인 선택지로 제시됩니다. 그러나 경량 모델은 제한된 메모리와 추론 능력 때문에 SQL 실행 오류를 자주 내고, 재순위화나 반복 수정에 의존하는 기존 Inference Time 자가 교정도 추가 컨텍스트를 충분히 처리하지 못했습니다. ReSQL은 이 한계를 모델이 생성한 오류를 학습 가능한 추론 데이터로 바꾸는 방식으로 해결하려 했습니다.
02

오류를 추론 데이터로 바꾸는 폐쇄 루프

ReSQL은 모델의 실패 사례를 수집하고 오류 원인을 학습시킨 뒤 다시 추론에 활용하는 세 단계 폐쇄 루프입니다. SQL 실행에 실패하면 정답 쿼리와 오류 메시지를 모델에 제공하고, 모델은 잘못된 쿼리의 동작과 문제 지점, 수정 방향을 구조화된 오답 노트로 작성합니다. 이 데이터를 원본 학습 데이터와 결합해 같은 모델을 LoRA로 파인튜닝하면서 단순 정답 암기가 아니라 오류를 단계적으로 진단하는 Chain-of-Thought를 파라미터에 반영합니다. 실제 추론에서는 오류-추론 저장소에서 현재 오류와 가까운 상위 3개 사례를 검색해 Few-Shot 예시로 넣으므로, 파인튜닝이 일반적인 오류를 처리하고 RAG가 드문 오류를 보완하는 구조입니다.
ReSQL이 오류 데이터를 만들고 학습한 뒤 검색 기반 추론에 재사용하는 세 단계 폐쇄 루프를 나타낸 도식입니다.
Diagram도식의 왼쪽 위에서는 학습 데이터에 포함된 질문과 실행 오류, 오류 메시지를 바탕으로 모델이 오답 SQL의 문제를 추론 데이터로 변환합니다. 왼쪽 아래에서는 원본 데이터와 생성 샘플을 결합해 Fine-Tuned LM과 Vector Database를 만들고, 오른쪽에서는 현재 오류와 유사한 사례를 검색해 수정 SQL 생성에 활용합니다. 본문의 Reasoning Data Construction, Self-Improving Training, Retrieval-Augmented Inference가 입력·처리·출력 순서로 연결된 구조를 시각화합니다.
03

1B부터 9B까지 확인된 성능 변화

ReSQL의 효과는 SPIDER와 BIRD의 실행 정확도와 교정률로 측정됐습니다. BIRD에서 Llama-3.2 1B의 실행 정확도는 3.78%에서 24.84%로 약 7배 높아졌고, Gemma-2 2B는 13.36%에서 26.92%, CodeS-1B는 22.23%에서 34.94%로 상승했습니다. ReSQL로 학습한 7~9B 모델은 SPIDER 81.29%, BIRD 53.78%를 기록해 GPT-4에 적용된 고도화된 교정 기법의 79.98%와 49.87%를 각각 웃돌았습니다. 처음 틀린 쿼리를 의미적으로 올바른 결과로 바꾸는 평균 교정률은 SPIDER에서 64.38%였고, Extra Hard 쿼리에서도 39.32%를 기록했습니다.
Llama 계열과 GPT 모델에서 ReSQL, Baseline, Simple, GPT-4, GPT-3.5의 SPIDER·BIRD 성능을 난이도별로 비교한 막대그래프입니다.
Chart그래프는 Llama 1B·3B·8B와 GPT 모델을 열로 나누고, SPIDER와 BIRD를 행으로 배치해 Easy부터 Extra, Total까지 난이도별 결과를 비교합니다. ReSQL 막대는 Llama 계열의 여러 크기에서 Baseline과 Simple보다 높게 나타나며, 본문에 제시된 7~9B 모델의 SPIDER 81.29%와 BIRD 53.78%, GPT-4 교정 기법의 79.98%와 49.87% 비교를 뒷받침합니다. 모델 크기와 오류 교정 학습 방식에 따라 실행 결과가 달라진다는 점을 한눈에 확인하게 합니다.
04

검색 증강과 데이터 품질의 역할

오류 유형별 결과에서는 빈번한 문법 오류보다 학습 데이터에 드문 Long-Tail Errors에서 Retrieval-Augmented Generation의 효과가 크게 나타났습니다. 컬럼명 모호성 오류는 36.5%, 다중 문장 오류는 39.4%, UNION 앞 ORDER BY 오류는 73.1% 감소했고, GROUP BY 내 집계 함수 오류는 100% 제거됐습니다. 오류 추론 데이터를 제외한 제거 실험에서는 BIRD 실행 정확도가 17.61%p 하락해 구조화된 오답 데이터가 성능의 중심 요소임을 확인했습니다. 생성 데이터의 정확도는 G-Eval에서 85% 이상, Llama-3.1 8B 생성 데이터에서는 97.2%였으며 인간 평가에서도 진단 정확성 97.5%를 기록했고, 추론 오버헤드는 평균 약 100토큰과 1.2초 미만이었습니다.
05

오픈소스 공개와 다음 연구 방향

LG AI연구원은 재현성과 생태계 확장을 위해 ReSQL 데이터 생성 프레임워크 코드와 1B~9B 모델이 만든 전체 추론 데이터셋을 GitHub에 공개했습니다. 현재 구조는 정답 SQL이 있는 상태에서 오류 추론 데이터를 만들고 실행 실패 이후에 수정하는 방식이므로, 다음 단계에서는 오류가 발생하기 전에 위험을 예측하는 선제적 예방을 목표로 삼습니다. 정답 SQL 없이도 자기 개선을 수행하는 완전한 비지도 학습과, 보지 못한 데이터베이스 스키마와 새로운 산업 도메인에서의 강건성 검증도 확장 방향에 포함됩니다. 실행 피드백을 얻을 수 있는 코딩과 AI 에이전트의 Tool Use로 같은 자기 개선 방식을 넓히려는 계획도 제시됐습니다.

용어 해설

자연어-SQL 변환(Text-to-SQL)
자연어 질문을 데이터베이스에서 실행할 수 있는 SQL 쿼리로 바꾸는 기술입니다. 모델은 질문과 데이터베이스 스키마를 입력받아 쿼리를 생성하고, 실행 결과가 의도한 답과 일치하는지로 품질을 평가받습니다. SQL 전문 지식 없이도 기업 데이터를 조회하게 하는 기반 기술입니다.
실행 정확도(Execution Accuracy)
생성된 SQL을 실제 데이터베이스에서 실행한 결과가 정답 SQL의 실행 결과와 일치하는 비율입니다. SQL 문법이나 작성 방식이 서로 달라도 같은 결과를 반환하면 정답으로 계산합니다. Text-to-SQL 모델이 문장 형태가 아니라 실제 질의 목적을 달성했는지 측정하는 지표입니다.
장꼬리 오류(Long-Tail Errors)
학습 데이터에서 자주 나타나지 않아 일반적인 파인튜닝만으로 해결하기 어려운 드문 오류 유형입니다. ReSQL은 과거 오류와 추론 과정을 저장한 뒤 현재 오류와 유사한 사례를 검색해 보완합니다. 빈도가 낮은 스키마·문법 조합에 대응하는 데 검색 증강의 가치가 커집니다.
LoRA
대규모 언어 모델의 전체 가중치를 갱신하지 않고 저순위 행렬을 추가 학습하는 파인튜닝 방식입니다. 원본 모델 대부분을 고정한 채 적은 수의 파라미터만 조정하므로 메모리와 학습 비용을 줄일 수 있습니다. ReSQL은 오류 추론 데이터를 원본 데이터와 합쳐 LoRA 방식으로 모델을 다시 학습시킵니다.
Few-Shot 학습(Few-Shot)
모델이 새로운 입력을 처리할 때 소수의 예시를 문맥으로 함께 제공받아 출력 방식을 추론하는 방법입니다. ReSQL은 현재 SQL 오류와 유사한 과거 오류-추론 사례 3개를 검색해 입력에 포함합니다. 모델이 드문 오류의 진단과 수정 방향을 기존 사례에서 참고하도록 만드는 방식입니다.

기술

  • Text-to-SQL
  • Large Language Model (LLM)
  • Self-Correction
  • LoRA
  • Chain-of-Thought
  • Retrieval-Augmented Generation (RAG)
  • G-Eval
  • SPIDER
  • BIRD

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 27.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.