nvidia/NVIDIA-Nemotron-Parse-2.0
ViT-H + mBART 기반의 문서 파싱용 vision-encoder-decoder 모델
학습 방식 · 학습 데이터는 문서 페이지와 표 이미지에 대한 OCR 텍스트·박스·레이아웃 라벨을 포함한 수백만 건의 이미지·텍스트 쌍을 혼합 방식(hybrid: automated, human, synthetic)으로 수집하여 학습에 사용했습니다. 모델 구조는 ViT-H 기반 비전 인코더에서 추출한 비전 라텐시를 1D convolution과 normalization으로 압축한 뒤 mBART 디코더(10블록)로 시퀀스 생성하는 파이프라인을 따르며, 학습 시 체크포인트 수개(58k, 60k, 62k, 64k, 66k)를 동등 가중치(equal-weight)로 혼합한 스냅샷 수렴을 사용해 최종 체크포인트를 얻었습니다. 이러한 설계는 시각적 레이아웃 정보를 디코더 친화적 토큰 시퀀스로 변환하고, 토크나이저 확장과 차트 클래스 토큰을 통해 다국어·차트·표 중심의 문서 분포에서 더 안정적인 생성과 구조 회복을 가능하게 합니다.
TL;DR
Nemotron Parse 2.0은 ViT-H 비전 인코더(기반: NVIDIA C-RADIO)와 mBART 디코더를 결합한 Transformer 기반 vision-encoder-decoder 문서 파서로, 이미지와 제어 프롬프트를 받아 텍스트·의미 클래스·바운딩박스·읽기순서를 구조화된 문자열로 출력합니다. 토크나이저는 약 72,256개 어휘(기존보다 약 2만 토큰 확장)를 포함해 다국어·CJK·Indic 지원을 강화하고, <class_Chart> 등 차트 전용 클래스 토큰과 표/차트 후처리 유틸리티로 차트-테이블 변환을 지원합니다. 내부 비교에서 ParseBench, IndicVisionBench, MOSCAR 등 주요 벤치마크에서 v1.2 대비 큰 개선이 보고되며, 손글씨·표·차트가 많은 문서에 특히 성능 이점이 있습니다. 권장 입력 해상도는 가로 1024~1664, 세로 1280~2048이며, Transformers·vLLM 환경과 NVIDIA GPU에서의 가속을 전제로 실사용 배포가 권장됩니다.
핵심 포인트
- 문서 이미지에서 제목·단락·캡션·표·차트·헤더·푸터·각주·그림·참고문헌 등 다양한 요소를 텍스트와 클래스·바운딩박스·읽기 순서로 함께 생성하는 multimodal 파서입니다. 입력 처리 과정은 ViT-H 비전 인코더로 이미지 특징을 뽑고, 어댑터(1D convolution + normalization)로 비전 시퀀스를 압축한 뒤 mBART 디코더(10블록)가 제어 토큰을 따라 구조화 텍스트를 생성하는 흐름을 따릅니다. 이 출력은 제공된 후처리 유틸리티로 원래 이미지 좌표계로 재매핑하거나 표/차트를 LaTeX·HTML·Markdown·JSON·CSV 등으로 변환하도록 설계되어 있습니다.
- 토크나이저는 이전 버전보다 약 2만 토큰이 확장된 72,256개 어휘를 포함해 다국어 토큰 효율을 높였고, <predict_bbox>, <predict_classes>, <predict_text_in_pic>, <predict_no_text_in_pic>, <class_Chart> 같은 제어/클래스 토큰을 통해 생성 동작을 세밀하게 제어할 수 있습니다. 제어 토큰을 프롬프트로 조합하면 바운딩박스만, 텍스트 포함 여부, 마크다운 출력 등 출력 형식을 프롬프트 수준에서 지정할 수 있습니다. 토크나이저 사용은 CC-BY-4.0 라이선스 조건을 따릅니다.
- 파싱 능력에서는 차트 인식과 표 구조 복구, 그리고 CJK·Indic 언어와 필기체 텍스트 추출에서 큰 개선을 목표로 학습 데이터와 토크나이저를 확장했습니다. 공개된 비교에서 ParseBench 전체 점수가 v1.2 대비 +0.0609로 올랐고, IndicVisionBench와 MOSCAR에서 대폭 향상된 문자·언어별 성능을 보입니다. 표·차트가 많은 문서나 손글씨가 섞인 노트 스타일 문서 전처리·데이터 큐레이션에 특히 유용한 출력 품질을 제공합니다.
- 배포·추론 측면에서는 Transformers와 vLLM 양쪽에서 실행 예제가 제공되며, vLLM과 함께 쓸 때는 Nemotron Parse용 원격 코드 패치와 logits processor를 통해 반복 생성 제어와 표 삽입 강제 등 맞춤 제어를 적용할 수 있습니다. 권장 입력 해상도는 가로 1024~1664, 세로 1280~2048 범위로 제시되어 있고, H100/A100 같은 NVIDIA GPU에서 성능 최적화를 기대할 수 있습니다. vLLM 예제는 max_tokens 9000 수준의 길이와 bfloat16·top_k=1 같은 설정을 권장합니다.
제한사항
- 모델과 예제는 NVIDIA GPU(A100/H100 등)에서 최적화된 성능을 전제로 동작하도록 안내되어 있어 CPU 전용 환경에서는 학습·추론 비용과 지연이 크게 증가할 수 있습니다. vLLM 서빙 시에는 Nemotron Parse용 원격 코드와 vLLM 패치를 적용해야 출력 헤드의 가중치 결합(tied embeddings)이 유지되는 점을 유념해야 합니다. 따라서 배포 환경 준비와 런타임 패치 적용 및 GPU 자원 검증이 사전 요구사항으로 남아 있습니다.
- 학습 데이터와 라벨링은 자동화·인간·합성 파이프라인을 혼합해 구축되었고, 내부 및 공개 벤치마크로 성능을 평가했기 때문에 데이터 소스와 라벨링 방식에 따른 편향·노이즈 가능성이 존재합니다. 문서에 포함된 개인 식별 정보·건강 정보·기업 기밀 등은 모델이 시각적 텍스트를 추출하여 재현할 수 있으므로 입력 권리 및 개인정보 보호 정책 준수가 필요합니다. 모델 통합 전에는 도메인별 유효성 검사와 리스크 평가, 인간 검토 루프 설계가 권장됩니다.
- 토크나이저는 CC-BY-4.0 조건을 따르지만 모델 전체는 NVIDIA Open Model License로 제공되어 라이선스 검토가 필요합니다. 상업적 사용 가능으로 표기되어 있으나, 조직별 법무·준법 검토를 통해 사용 제한과 재배포 조건을 확인해야 합니다. 또한 차트·표 변환 후처리의 정확도는 입력 이미지 해상도와 표·차트의 시각적 복잡도에 민감하므로 전처리와 해상도 권장치(최소 1024×1280)를 지켜야 성능 변동을 줄일 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| ParseBench | Overall score | 0.6391 | vs v1.2: 0.5782 → 0.6391 (+0.0609) |
| OmniDocBench Notes (Handwriting) | Text edit distance (lower is better) | 0.3395 | vs v1.2: 0.9739 → 0.3395 (Δ -0.6343) |
| IndicVisionBench | Overall ANLS character | 0.7203 | vs v1.2: 0.0612 → 0.7203 (+0.6592) |
| MOSCAR (Multilingual) | Overall BoC F1 | 0.9102 | vs v1.2: 0.4410 → 0.9102 (+0.4692) |
73
Likes
3.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.