본문으로 건너뛰기

Dataset Generator: LLM 미세 조정을 위한 노코드 합성 데이터 생성 도구

Dataset Generator는 주제 기획부터 LLM 판사를 통한 품질 검증까지 자동화하여 LLM 미세 조정용 합성 데이터를 생성하는 노코드 데스크톱 앱이다.

섹션별 상세

기존의 단순한 데이터 생성 방식은 반복적인 패턴이 나타나는 문제가 있었다. Dataset Generator는 주제 기획, 개요 작성, 실제 예시 생성의 3단계 'Plan-then-Execute' 파이프라인을 사용하여 데이터의 중복을 피하고 일관성을 유지한다. 이를 통해 사용자가 설정한 카테고리와 비율에 맞춘 정교한 데이터셋 구성이 가능하다.
근거
  • Dataset Generator는 주제 기획, 개요, 예시 생성의 3단계 엔진을 사용한다. About 섹션의 'three-stage engine' 설명
데이터의 품질을 보장하기 위해 사람이 직접 검수하는 대신 LLM Judge 기능을 도입했다. 두 번째 LLM 모델이 생성된 각 예시를 0점에서 100점 사이로 평가하며 설정된 기준 점수보다 낮은 데이터는 즉시 폐기하고 다시 생성한다. 이 과정은 실시간 대시보드를 통해 시각적으로 확인할 수 있으며 최종적으로 고품질의 데이터만 추출된다.
실제 성능 검증을 위해 Qwen2.5-Coder-7B-Instruct 모델을 이 도구로 생성된 데이터로 미세 조정했다. 1,135개의 샘플로 학습시킨 결과 HumanEval 벤치마크에서 베이스 모델의 55.5%보다 높은 60.0%의 성능을 기록했다. 이는 적은 양의 고품질 합성 데이터만으로도 모델의 코딩 능력을 유의미하게 향상시킬 수 있음을 입증한다.
베이스 모델과 Dataset Generator로 생성된 데이터로 미세 조정된 모델 간의 HumanEval 벤치마크 성능 비교 차트
ChartQwen2.5-Coder-7B-Instruct 베이스 모델과 비교하여 이 도구의 파이프라인(V2)으로 생성된 1,135개의 샘플로 학습했을 때 HumanEval에서 4.5%p, HumanEval+에서 5.0%p의 성능 향상이 있음을 보여줍니다. 오차 막대가 겹치지 않아 통계적으로 유의미한 성능 개선이 이루어졌음을 증명합니다.
근거
  • FT V2 데이터셋으로 학습된 모델은 HumanEval에서 베이스 모델 대비 4.5%p 향상된 60.0%를 기록했다. Benchmark 섹션의 표 및 차트 이미지 출처
사용자의 편의성을 위해 복잡한 환경 설정 없이 실행 가능한 데스크톱 앱 형태로 제공된다. 모든 데이터와 API 키는 로컬 SQLite 데이터베이스에 저장되어 보안을 유지하며 OpenRouter를 통해 300개 이상의 모델을 선택하여 사용할 수 있다. 생성된 데이터는 ShareGPT, Alpaca, ChatML 등 주요 학습 포맷으로 즉시 내보내거나 Hugging Face Hub에 직접 업로드할 수 있다.

용어 해설

합성 데이터(Synthetic Data)
실제 세계의 사건에서 수집된 데이터가 아니라 AI 모델을 사용하여 인위적으로 생성한 데이터이다. 데이터 부족 문제를 해결하고 특정 도메인에 특화된 학습 데이터를 대량으로 확보하는 데 필수적이다.
판사로서의 LLM(LLM-as-a-Judge)
생성된 데이터의 품질을 사람이 직접 확인하는 대신 성능이 뛰어난 다른 LLM을 사용하여 평가하는 기법이다. 설정된 기준에 따라 점수를 매기고 부적절한 데이터를 걸러내어 데이터셋의 품질을 자동화된 방식으로 유지한다.
지도 미세 조정(SFT)
사전 학습된 모델을 특정 작업이나 대화 형식에 맞게 조정하기 위해 레이블이 지정된 데이터셋으로 추가 학습시키는 과정이다. 모델이 사용자의 지시사항을 더 잘 따르고 특정 도메인의 지식을 습득하도록 돕는다.
ShareGPT 형식(ShareGPT)
LLM 학습을 위해 널리 사용되는 다회차 대화 데이터 포맷이다. 사용자(human)와 모델(gpt) 간의 대화 기록을 구조화된 JSON 형태로 저장하여 복잡한 대화 맥락을 학습시키는 데 적합하다.

코드 예제

bash
git clone https://github.com/AronDaron/dataset-generator.git
cd dataset-generator
# Backend
cd backend
python3 -m venv venv
./venv/bin/pip install -r requirements.txt
./venv/bin/uvicorn app.main:app --reload --port 8000

Dataset Generator의 백엔드 서버를 로컬 환경에서 설치하고 실행하는 방법

기술

  • OpenRouter
  • Qwen2.5-Coder
  • Llama
  • DeepSeek
  • Mistral
  • FastAPI
  • Next.js
  • SQLite

활용 사례

  • 도메인 특화(법률, 의료, 고객 지원) 어시스턴트 학습 데이터 생성
  • 다회차 대화형 에이전트 행동 학습을 위한 데이터셋 구축
  • 다양한 카테고리 구성을 통한 모델 성능 변화 실험

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 21.수집 2026. 04. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.