본문으로 건너뛰기
r/LocalLLaMA조회 1

바이두, 4B 파라미터 엔드투엔드 문서 이해 모델 'Qianfan-OCR' 오픈소스 공개

바이두가 레이아웃 추론 기법을 도입하여 192개 언어를 지원하고 대형 모델보다 높은 성능을 기록한 4B 규모의 엔드투엔드 문서 이해 모델 Qianfan-OCR을 공개했다.

실용적 조언

  • 높은 정확도가 필요한 복잡한 양식의 문서에는 Layout-as-Thought 기능을 활성화하여 사용하고, 단순 텍스트 추출 시에는 비활성화하여 속도를 높일 수 있다.
  • vLLM을 사용하여 즉시 서빙이 가능하므로 기존 LLM 인프라에 쉽게 통합하여 문서 처리 자동화에 활용 가능하다.

섹션별 상세

01
Qianfan-OCR은 기존의 '검출-인식-LLM'으로 이어지는 복잡한 파이프라인 대신 단일 순전파(Forward Pass)로 모든 과정을 처리하는 엔드투엔드 방식을 채택했다. 이를 통해 OCR, 레이아웃 분석, 표 추출, 수식 및 차트 이해, 핵심 정보 추출(KIE)을 통합적으로 수행하며 시스템 복잡도를 낮췄다.
02
'Layout-as-Thought'라는 독창적인 개념을 도입하여 모델이 최종 출력을 생성하기 전에 바운딩 박스, 요소 유형, 읽기 순서 등을 먼저 추론하도록 설계했다. 이는 텍스트 생성에서의 Chain-of-Thought와 유사한 방식으로 작동하며, 사용자의 필요에 따라 정확도 우선 또는 속도 우선 모드로 전환이 가능하다.
03
성능 면에서 4B라는 비교적 작은 파라미터 수에도 불구하고 OmniDocBench v1.5에서 93.12점을 기록하며 엔드투엔드 모델 중 1위를 차지했다. 특히 핵심 정보 추출(KIE) 평균 점수에서 Gemini-3.1-Pro나 Qwen3-VL-235B와 같은 거대 모델들을 앞서는 결과를 보여주었다.
04
실무 적용성을 높이기 위해 W8A8 양자화를 적용했을 때 A100 GPU 한 장에서 초당 1.024페이지를 처리하는 속도를 확보했다. 또한 한국어를 포함한 CJK 언어와 라틴어, 아랍어 등 총 192개 언어를 지원하며 vLLM 라이브러리를 통해 즉시 배포가 가능하다는 점이 특징이다.

용어 해설

레이아웃 사고 기법(Layout-as-Thought)
모델이 최종 텍스트를 생성하기 전 문서의 바운딩 박스, 요소 유형, 읽기 순서 등을 먼저 추론하는 단계이다. 텍스트 모델의 Chain-of-Thought와 유사하게 문서 구조를 먼저 파악함으로써 복잡한 레이아웃에서의 추출 정확도를 높인다.
엔드투엔드 모델(End-to-End Model)
입력 데이터부터 최종 출력까지 여러 단계의 독립된 모듈을 거치지 않고 하나의 신경망으로 처리하는 구조이다. OCR에서는 별도의 텍스트 검출 및 인식 모듈 없이 이미지 입력에서 직접 구조화된 텍스트를 출력한다.
핵심 정보 추출(KIE)
Key Information Extraction의 약자로, 문서 이미지 내에서 이름, 날짜, 금액 등 특정 의미를 가진 핵심 데이터만 식별하여 추출하는 기술이다. 비정형 문서의 정형 데이터화에 필수적인 과정이다.
W8A8 양자화(W8A8 Quantization)
모델의 가중치(Weights)와 활성화 함수(Activations)를 모두 8비트 정수로 변환하여 연산 효율을 높이는 기법이다. 메모리 사용량을 줄이고 추론 속도를 대폭 향상시키면서도 정밀도 손실을 최소화한다.

언급된 도구

vLLM추천

고성능 추론 및 서빙 엔진

Qianfan-OCR추천

엔드투엔드 시각-언어 문서 이해 모델

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 19.수집 2026. 03. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.