본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

datalab-to/lift

PDF·이미지 문서에서 주어진 JSON Schema를 기준으로 필드 수준의 구조화된 JSON을 생성(이미지-텍스트→텍스트 변환, 스키마 제약 디코딩 포함)9Bopenrail

사용자가 전달한 JSON Schema에 맞춰 PDF와 이미지에서 구조화된 JSON을 단일 패스로 추출하는 멀티모달 9B 모델이다.

TL;DR

lift는 PDF와 이미지에서 사용자가 정의한 JSON Schema에 맞춰 구조화된 JSON을 반환하는 멀티모달 추출 모델이다. 디코더 단계에서 스키마 제약을 적용해 반환이 항상 스키마 타입과 구조에 맞도록 보장하며, 멀티페이지 문서를 단일 패스로 처리해 페이지를 넘는 값도 추적한다. 벤치마크(225문서)에서 lift는 필드 정확도 90.2%를 기록했고, 로컬 vLLM 기반 실행 시 문서당 중앙 레이턴시가 9.5초로 빠른 응답성을 보였다. 호스팅 API는 추가로 필드별 검증, 인용(citations), 신뢰도 점수를 제공해 감사·검증 용도에 적합하다. 결과적으로 lift는 스키마 기반 정밀 추출과 낮은 레이턴시를 균형 있게 제공하지만, README의 표에 따르면 전체 문서가 완전히 정확한 비율(Full-document accuracy)은 20.9%로 낮아 '모든 필드가 완전한 정답'이라는 조건에서는 한계가 있다. 또한 모델 가중치는 수정된 OpenRAIL-M 라이선스 제약을 따르므로 상업적 사용 조건을 확인해야 한다.

핵심 포인트

  • 스키마 제약 디코딩을 통해 출력 JSON의 타입·구조 유효성을 보장하는 점
  • 멀티페이지 문서를 한 번에 처리해 페이지를 넘는 값까지 추적하는 기능
  • vLLM 연동을 권장해 로컬 단일 GPU에서 비교적 낮은 문서당 중앙 레이턴시를 달성한 점
  • 호스팅 API에서 제공하는 필드 수준 검증과 인용 기능으로 신뢰성·감사 근거를 함께 제공하는 점

벤치마크

벤치마크지표비교
Datalab APIField accuracy95.9%
Gemini Flash 3.5Field accuracy91.3%
liftField accuracy90.2%
Azure Content UnderstandingField accuracy83.4%
NuExtract3Field accuracy81.5%
Qwen3.5-9BField accuracy76.3%
liftMedian latency9.5s
Datalab APIMedian latency30.8s
Azure Content UnderstandingMedian latency73.7s
NuExtract3Median latency8.3s

이미지 분석

225문서 벤치마크의 필드 정확도 바 차트(모델별 필드 accuracy).
차트는 Datalab API(95.9%)와 Gemini Flash 3.5(91.3%)가 가장 높은 필드 정확도를 보였고, lift는 90.2%로 상위권(세 번째)에 위치했다. 나머지 비교 모델들은 80%대 이하로 표시되어 lift가 경쟁력 있는 필드 수준 정확도를 제공함이 확인된다.
같은 225문서 벤치마크의 모델별 문서당 중앙 레이턴시 바 차트(초 단위).
레이턴시 차트에서 lift는 9.5초로 NuExtract3(8.3s)에 근접한 낮은 중앙 레이턴시를 보였고, Qwen3.5-9B(16.8s), Gemini(28.1s), Datalab API(30.8s), Azure(73.7s)보다 빠르다. Azure 수치는 문서당 한 번의 analyzer 빌드를 포함해 재사용 시에는 분석 단계만 재사용 가능하다는 주석이 있다.

166

LIKES

7.1k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.