본문으로 건너뛰기

DataFlow: 데이터 중심 AI를 위한 LLM 데이터 생성 및 정제 통합 프레임워크

DataFlow는 노이즈가 많은 원시 데이터를 고품질 LLM 학습 데이터셋으로 변환하기 위해 시각적 파이프라인과 에이전트 기반 자동화를 제공하는 데이터 중심 AI 시스템이다.

섹션별 상세

DataFlow는 데이터 준비 과정을 연산자 단위로 캡슐화하여 재사용성과 재현성이 높은 파이프라인을 구축할 수 있게 한다. 10개 이상의 핵심 연산자와 100개 이상의 특정 파이프라인 연산자를 제공하며, 사용자는 PyTorch와 유사한 계층 구조를 통해 워크플로우를 제어한다.
python
from dataflow.operators.core_text import PromptedGenerator
from dataflow.utils.storage import FileStorage
from dataflow.serving import APILLMServing_request

storage = FileStorage(first_entry_file_name="./input.json",)
llm_serving = APILLMServing_request(
    api_url="https://api.openai.com/v1/chat/completions",
)
prompted_generator = PromptedGenerator(
    llm_serving=llm_serving,
    system_prompt="Please solve this math problem."
)
prompted_generator.run(
    storage=self.storage.step(),
    input_key="problem",
    output_key="solution"
)

PromptedGenerator 연산자를 사용하여 입력된 수학 문제를 LLM API를 통해 해결하고 결과를 저장하는 예시

DataFlow의 데이터 처리 워크플로우를 보여주는 인포그래픽 다이어그램이다.
Infographic코드, QA, PDF 등 다양한 원시 데이터 소스가 DataFlow 시스템을 거쳐 고품질의 LLM 최적화 데이터셋으로 변환되는 과정을 시각화했다. 생성된 데이터가 SFT, CoT, RAG, RL 등 다양한 학습 및 응용 분야에 사용될 수 있음을 나타낸다.
시스템은 WebUI, Agent, Ecosystem, RayOrch의 4개 계층으로 구성된다. WebUI는 드래그 앤 드롭 방식의 시각적 인터페이스를 제공하고, DataFlow-Agent는 사용자의 의도에 따라 연산자를 동적으로 조합하며, RayOrch는 Ray 기반의 분산 컴퓨팅으로 대규모 데이터 처리를 가속화한다.
텍스트, 수학, 코드 도메인에 특화된 데이터 합성 파이프라인을 지원한다. 대규모 PDF 문서를 QA 쌍으로 변환하거나, 기존 데이터를 Chain-of-Thought로 확장하고 난이도를 추정하는 등의 정교한 데이터 가공이 가능하다.
실험 결과 DataFlow로 생성한 10K 규모의 데이터셋이 수백만 개의 샘플을 가진 기존 데이터셋보다 Qwen2.5-7B 모델의 수학 및 코드 성능을 더 효과적으로 향상시켰다. 특히 수학 벤치마크에서 기존 대비 약 10% 이상의 성능 향상을 기록하며 데이터 품질의 중요성을 증명했다.
Docker 및 Google Colab 환경을 지원하여 설치와 배포가 용이하다. Python 3.10 이상의 환경에서 uv 패키지 매니저를 통해 빠르게 설치할 수 있으며, 로컬 GPU 추론을 위한 vLLM 통합도 지원한다.

용어 해설

지도 미세 조정(SFT)
사전에 레이블링된 데이터셋을 사용하여 모델을 특정 작업이나 도메인에 맞게 조정하는 과정이다. 모델이 사용자의 지시사항을 따르거나 특정 형식으로 답변하도록 학습시키는 핵심 단계이다.
사고의 사슬(CoT)
모델이 복잡한 문제를 해결할 때 중간 추론 단계를 명시적으로 생성하도록 유도하는 기법이다. 수학적 문제나 논리적 추론이 필요한 작업에서 모델의 정확도를 크게 향상시킨다.
데이터 중심 AI(Data-Centric AI)
모델 아키텍처의 개선보다 학습 데이터의 품질과 구조를 개선하는 데 집중하는 인공지능 개발 패러다임이다. 고품질의 정제된 데이터를 통해 더 적은 자원으로도 높은 성능을 달성하는 것을 목표로 한다.
오케스트레이션(Orchestration)
복잡한 시스템이나 여러 컴퓨팅 자원 간의 작업 흐름을 조율하고 관리하는 기술이다. DataFlow에서는 Ray를 활용하여 대규모 데이터 처리 작업을 여러 노드에 분산시키고 효율적으로 실행한다.
연산자(Operator)
데이터 처리 파이프라인 내에서 특정 기능을 수행하는 독립적인 모듈 단위이다. 텍스트 생성, 필터링, 정제 등 각각의 작업이 연산자로 캡슐화되어 재사용과 조합이 용이하다.

기술

  • Python
  • Ray
  • vLLM
  • PyTorch
  • Docker

활용 사례

  • 고품질 SFT 학습 데이터셋 생성
  • PDF 및 비정형 문서의 QA 데이터 변환
  • 수학 및 코드 추론 데이터 합성
  • RAG 시스템용 지식 베이스 정제
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 17.수집 2026. 03. 17.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.