TL;DR
Raj Suthan은 스캔본, 깨진 표, 도표, 수식이 포함된 PDF를 검색 가능한 청크로 바꾸는 Apache 2.0 프로젝트 meridian을 공개했습니다. Docling이 문서 레이아웃과 시각 영역을 추출하고, 수식 페이지에는 번호 상자를 그린 뒤 Qwen3-VL-8B를 vLLM에서 동시 호출해 표·그림·수식 설명을 생성합니다. 설명은 원래 순서에 맞춰 청크에 삽입되고 Ollama 임베딩과 Qdrant 저장을 거치며, CPU Celery 워커와 장기 실행 GPU 서비스를 분리해 모델 중복 로딩을 피합니다. 단일 H200에서 20개 논문은 118.7 pages/min, 조정 후 Apollo 시대 NASA 보고서 25개는 77.2 pages/min과 zero failures를 기록했지만 단일 문서 처리 속도는 약 10 pages/min입니다. GPU를 쓰지 않는 pypdfium2 경로는 32개 CPU 워커로 NASA 문서 1,000개를 1분 이내 처리하는 대신 표와 그림을 버리는 절충을 택합니다.
실용적 조언
- 표·그림·수식의 검색 가능성이 중요하면 Docling으로 시각 영역을 분리한 뒤 VLM 설명을 청크의 원래 순서에 다시 삽입하는 GPU 경로를 사용하십시오.
- 대량 문서에서 텍스트 검색만 필요하면 pypdfium2와 CPU 워커 경로를 선택하십시오. 이 경로는 32개 CPU 워커로 NASA 문서 1,000개를 1분 이내 처리했지만 표와 그림은 보존하지 않습니다.
- 문서별 처리 시간이 아니라 전체 처리량을 높이려면 CPU 워커와 장기 실행 GPU 서비스를 분리하고, 여러 문서를 서로 다른 파이프라인 단계에 동시에 배치하십시오.
- Celery soft limit에 걸리는 문서가 있으면 배치 상태를 Redis에 저장하고 인스턴스 수와 작업 설정을 조정해 재시도 가능한 실행 구조를 유지하십시오.
섹션별 상세
이미지 분석

이미지는 meridian 저장소가 PDF에서 표·그림·수식을 추출하고 vision-language model로 읽어 검색 가능한 결과를 만드는 프로젝트임을 보여줍니다. 본문에서 설명한 파이프라인의 목적과 저장소 공개 사실을 시각적으로 뒷받침하지만, 처리량 수치나 세부 실행 구조는 포함하지 않습니다.
GitHub의 Rajsuthan/meridian 저장소 화면에 GPU 가속 문서 처리 파이프라인과 PDF의 표·그림·수식 추출 기능이 요약되어 있습니다.
용어 해설
- 비전 언어 모델(VLM)
- — VLM은 이미지와 텍스트를 함께 입력받아 이미지 속 표·그림·수식의 의미를 자연어로 변환하는 모델입니다. 이 글에서는 PDF에서 추출한 시각 자료를 읽고 검색 가능한 청크에 설명을 삽입하는 역할을 맡습니다. 따라서 일반적인 텍스트 추출만으로 누락되는 문서 정보를 보완합니다.
- 무상태 워커(Stateless Workers)
- — 무상태 워커는 작업 진행 정보를 프로세스 내부에 고정하지 않고 외부 저장소와 서비스에 의존하는 실행 단위입니다. 이 파이프라인에서는 CPU 기반 Celery 워커가 HTTP로 장기 실행 GPU 서비스를 호출하므로 워커마다 모델을 중복 로드하지 않습니다. 장애가 난 워커를 교체하거나 작업을 재시도하기 쉬운 구조입니다.
- 부하 분산(Load Balancing)
- — 부하 분산은 여러 처리 인스턴스에 작업을 나누어 특정 인스턴스에 요청이 몰리지 않게 하는 방식입니다. 글에서는 8개의 Docling 인스턴스를 Redis의 원자적 카운터로 배정하고 watchdog으로 중단된 인스턴스를 재시작합니다. 여러 문서가 서로 다른 단계에서 동시에 처리되도록 해 전체 페이지 처리량을 높입니다.
- 벡터 데이터베이스(Vector Database)
- — 벡터 데이터베이스는 문서 청크를 임베딩 벡터로 저장하고 의미가 가까운 항목을 검색하는 저장소입니다. meridian은 표·그림·수식 설명이 삽입된 청크를 Ollama로 임베딩한 뒤 Qdrant에 저장합니다. 이 단계가 PDF 내용을 키워드뿐 아니라 의미 기반으로 찾는 검색 경로를 구성합니다.
언급된 도구
복잡한 PDF를 표·그림·수식 설명이 포함된 검색 가능한 청크로 변환하는 오픈소스 파이프라인입니다.
PDF 레이아웃을 감지하고 표·그림·수식 영역을 추출합니다.
추출된 표·그림·수식 페이지를 읽고 자연어 설명을 생성하는 VLM입니다.
Qwen3-VL-8B를 장기 실행 GPU 서비스로 호스팅합니다.
문서 청크를 임베딩하는 데 사용됩니다.
임베딩된 검색 청크를 저장합니다.
CPU 기반 무상태 워커에서 문서 처리 작업을 실행하고 soft limit과 재시도를 관리합니다.
GPU 없이 PDF에서 텍스트만 대량 추출하는 경로에 사용됩니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.