섹션별 상세
Docling은 IBM이 개발한 오픈소스 문서 프로세서로, PDF, DOCX, 이미지 등 다양한 형식을 처리하여 생성형 AI에 적합한 깨끗한 콘텐츠를 생성한다. OCR 기술과 레이아웃 분석 기법을 사용하거나 Granite-Docling-258M과 같은 Vision Language Model(VLM)을 활용해 문서의 읽기 순서와 구조를 파악한다. Langflow 1.5에서 처음 도입된 이후 1.6 버전에서는 File 컴포넌트의 고급 파서 기능을 통해 더욱 강력하게 통합되었다.
Langflow 내에서 PDF를 파싱하는 과정은 File 컴포넌트와 Chat Output 컴포넌트를 연결하는 것만으로 시작할 수 있다. 기본 파서는 텍스트 스트림 위주로 추출하지만, Advanced Parser를 활성화하면 Docling의 강력한 기능을 사용할 수 있다. 사용자는 표준 Docling 파이프라인, EasyOCR 엔진 추가, 또는 VLM 전용 파이프라인 중 하나를 선택하여 문서의 헤더와 구조를 보존한 Markdown 출력을 얻을 수 있다.


추출된 Markdown 데이터는 다양한 AI 애플리케이션의 기초가 된다. Prompt Template과 LLM을 연결하여 PDF 내용으로 대화하는 챗봇을 만들거나, Type Convert 컴포넌트를 거쳐 LangChain의 Recursive Text Splitter로 텍스트를 분할할 수 있다. 이후 임베딩 모델과 OpenSearch 같은 벡터 데이터베이스를 연결하면 문서 구조를 반영한 고품질 RAG 인제스션 파이프라인이 완성된다.



개발자는 Langflow API와 JavaScript 클라이언트를 사용하여 이 기능을 자신의 애플리케이션에 통합할 수 있다. 먼저 파일을 Langflow 서버에 업로드한 후, 반환된 파일 경로를 tweak 파라미터로 전달하여 플로우를 실행하는 방식이다. 이를 통해 사용자가 업로드한 문서를 실시간으로 파싱하고 처리하는 웹 서비스를 구축할 수 있다.
javascript
import { LangflowClient } from "@datastax/langflow-client";
const client = new LangflowClient({
baseUrl: process.env.LANGFLOW_BASE_URL,
apiKey: process.env.LANGFLOW_API_TOKEN,
});
const flow = client.flow(process.env.LANGFLOW_FLOW_ID);
// Step 1: Upload the file to Langflow
const uploadResponse = await client.files.upload(file);
// Step 2: Run the flow with the uploaded file path and pipeline mode as tweaks
const fileComponentName = process.env.LANGFLOW_FILE_COMPONENT_NAME;
const response = await flow
.tweak(fileComponentName, {
path: uploadResponse.path,
pipeline: mode,
})
.run("");Langflow JavaScript 클라이언트를 사용하여 파일을 업로드하고 파이프라인 모드를 조정하여 플로우를 실행하는 예시 코드
용어 해설
- 도클링(Docling)
- — IBM에서 개발한 오픈소스 문서 파싱 도구이다. PDF, DOCX, 이미지 등 다양한 형식의 문서에서 텍스트뿐만 아니라 표, 제목, 읽기 순서와 같은 복잡한 레이아웃을 AI 모델을 통해 구조적으로 파악하여 Markdown 형식으로 변환해준다. RAG 시스템의 데이터 전처리 품질을 높이는 데 핵심적인 역할을 한다.
- 시각 언어 모델(VLM)
- — Vision Language Model의 약자로, 이미지와 텍스트를 동시에 이해할 수 있는 멀티모달 AI 모델이다. Docling에서는 Granite-Docling-258M 모델을 사용하여 별도의 OCR 단계 없이 문서 페이지 전체를 시각적으로 분석하고 텍스트로 변환하는 파이프라인을 제공한다.
- 광학 문자 인식(OCR)
- — Optical Character Recognition의 약자로, 이미지나 스캔된 문서 내의 글자를 디지털 텍스트로 변환하는 기술이다. Docling은 EasyOCR과 같은 엔진을 통합하여 텍스트 레이어가 없는 PDF에서도 정확하게 정보를 추출할 수 있도록 지원한다.
- 검색 증강 생성(RAG)
- — Retrieval-Augmented Generation의 약자로, 외부 데이터베이스에서 관련 정보를 검색하여 LLM의 답변 생성에 활용하는 기법이다. PDF와 같은 소스 문서에서 깨끗하고 구조화된 데이터를 추출하는 것이 RAG 시스템의 성능을 결정짓는 중요한 첫 단계이다.
- 트윅(Tweak)
- — Langflow에서 플로우를 실행할 때 특정 컴포넌트의 설정값이나 입력 데이터를 동적으로 변경하는 기능이다. API 호출 시 파일 경로를 전달하거나 모델 파라미터를 조정하는 등 런타임에 플로우의 동작을 제어하는 데 사용된다.
기술
- Langflow
- Docling
- EasyOCR
- Granite-Docling-258M
- OpenSearch
- LangChain
활용 사례
- PDF 문서 기반 챗봇
- 문서 자동 요약 시스템
- RAG 데이터 인제스션 파이프라인
- 비정형 문서의 Markdown 변환 서비스
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 11. 28.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
