PDF·이미지에서 JSON 스키마로 바로 추출하는 9B 멀티모달 추출기
PDF·이미지 문서에서 주어진 JSON Schema를 기준으로 필드 수준의 구조화된 JSON을 생성(이미지-텍스트→텍스트 변환, 스키마 제약 디코딩 포함)9Bopenrail
사용자가 전달한 JSON Schema에 맞춰 PDF와 이미지에서 구조화된 JSON을 단일 패스로 추출하는 멀티모달 9B 모델이다.
TL;DR
lift는 PDF와 이미지에서 사용자가 정의한 JSON Schema에 맞춰 구조화된 JSON을 반환하는 멀티모달 추출 모델이다. 디코더 단계에서 스키마 제약을 적용해 반환이 항상 스키마 타입과 구조에 맞도록 보장하며, 멀티페이지 문서를 단일 패스로 처리해 페이지를 넘는 값도 추적한다. 벤치마크(225문서)에서 lift는 필드 정확도 90.2%를 기록했고, 로컬 vLLM 기반 실행 시 문서당 중앙 레이턴시가 9.5초로 빠른 응답성을 보였다. 호스팅 API는 추가로 필드별 검증, 인용(citations), 신뢰도 점수를 제공해 감사·검증 용도에 적합하다. 결과적으로 lift는 스키마 기반 정밀 추출과 낮은 레이턴시를 균형 있게 제공하지만, README의 표에 따르면 전체 문서가 완전히 정확한 비율(Full-document accuracy)은 20.9%로 낮아 '모든 필드가 완전한 정답'이라는 조건에서는 한계가 있다. 또한 모델 가중치는 수정된 OpenRAIL-M 라이선스 제약을 따르므로 상업적 사용 조건을 확인해야 한다.
핵심 역량
- 임의의 JSON Schema를 받아 문서에서 해당 필드들을 추출해 타입이 일치하는 JSON 객체로 반환
- 멀티페이지 문서를 한 번의 패스에서 처리해 페이지를 넘나드는 값(교차 페이지)을 추출
- 값이 문서에 없으면 null 반환, 숫자에 대해 허용 오차 적용한 엄격한 exact-match 규칙으로 비교 가능
- 로컬 추론(via HuggingFace) 및 vLLM 서버 기반 추론을 지원하고 CLI와 Streamlit 기반 Schema Studio 제공
- Datalab의 호스팅 API는 필드 수준 검증, 인용(citations) 및 신뢰도 점수 기능을 제공
강점
- 225문서 벤치마크에서 필드 정확도 90.2%로 상위권 성능을 보였고(데이터랩 API·Gemini와 비교 시 근접한 정확도), 문서당 중앙 레이턴시가 9.5초로 빠른 편이라 실무 파이프라인에 적합하다.
- 단일 패스로 멀티페이지·교차페이지 값을 처리하고 스키마 제약을 적용해 반환 JSON의 유효성을 확보한다는 점에서 후처리 부담을 줄인다.
알아두면 좋은 것
- 사용자가 전달한 표준 JSON Schema를 기반으로 스키마 제약 디코딩(schema-constrained decoding)을 적용해 유효하고 타입에 맞는 JSON을 반환한다.
- 멀티페이지 문서를 단일 패스로 처리하며, 페이지에 걸쳐 이어지는 값(cross-page values)도 추적해 추출한다.
- 로컬(via HuggingFace)과 vLLM 서버 두 가지 추론 모드를 제공하며 CLI와 Streamlit 기반 Schema Studio를 통해 스키마를 구축·테스트할 수 있다.
- 모델 가중치는 수정된 OpenRAIL-M 라이선스(메타데이터에 openrail 표기)를 따르며, 상업적 용도에는 제약(자체 API와의 경쟁 금지)이 있다.
기술적 특징
- 스키마 제약 디코딩: 사용자가 전달한 JSON Schema를 디코딩 단계에서 강제해 출력이 스키마와 타입에 맞는 유효한 JSON이 되도록 한다. 이로 인해 후처리로 구조를 검증하거나 타입을 정제하는 작업이 줄어든다.
- 멀티페이지 단일 패스 처리: 문서를 6~64페이지 범위에서 렌더된 페이지 이미지로 동일하게 입력하고 한 번의 추론으로 전체 문서를 처리해 페이지를 넘나드는 값(예: 교차 페이지 합계)을 잡아낸다. README에 따르면 모든 모델이 같은 렌더링을 받아 비교되었다.
- vLLM 우선권: 로컬 추론은 vLLM을 권장하며 vLLM 서버 구성(lift_vllm)과의 연동으로 낮은 중앙 레이턴시(벤치마크에서 9.5s)를 확보해 실시간성 요구가 있는 파이프라인에 유리하다.
- 호스팅 기능 보완: 호스팅 API는 필드별 검증·인용·신뢰도 점수를 제공해 단순 추출을 넘어 인간 검증 과정을 보조하고 법적·회계적 자료 검증에 유용한 근거를 함께 제공한다.
차별점
- 스키마 제약 디코딩을 통해 출력 JSON의 타입·구조 유효성을 보장하는 점
- 멀티페이지 문서를 한 번에 처리해 페이지를 넘는 값까지 추적하는 기능
- vLLM 연동을 권장해 로컬 단일 GPU에서 비교적 낮은 문서당 중앙 레이턴시를 달성한 점
- 호스팅 API에서 제공하는 필드 수준 검증과 인용 기능으로 신뢰성·감사 근거를 함께 제공하는 점
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Datalab API | Field accuracy | 95.9% | — |
| Gemini Flash 3.5 | Field accuracy | 91.3% | — |
| lift | Field accuracy | 90.2% | — |
| Azure Content Understanding | Field accuracy | 83.4% | — |
| NuExtract3 | Field accuracy | 81.5% | — |
| Qwen3.5-9B | Field accuracy | 76.3% | — |
| lift | Median latency | 9.5s | — |
| Datalab API | Median latency | 30.8s | — |
| Azure Content Understanding | Median latency | 73.7s | — |
이미지 분석


166
Likes
7.1k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.