1B로 OmniDocBench 94.91%·4,752 TPS를 달성한 계층적 병렬 문서 파서
계층적 병렬 디코딩과 P-MTP를 결합해 1B 모델로 OmniDocBench 94.91% 정확도와 최대 4,752 TPS를 달성한 고효율 문서 파서이다.
TL;DR
HPD-Parsing은 InternVL3.5-1B 기반의 1B 규모 문서 파서로서 전역 레이아웃 브랜치가 구조를 조정하고 지역별 콘텐츠 브랜치들이 병렬로 텍스트를 생성하는 계층적 병렬 디코딩을 도입해 긴 문서에서의 순차적 병목을 해소했다. 각 브랜치 내부에서는 P-MTP가 다수의 미래 토큰을 초안으로 제안하고 검증하는 speculative 방식으로 디코딩 스텝을 줄이며, 맞춤 vLLM은 페이지 단위 포킹과 shared-prefix KV 재사용으로 메모리 중복을 방지해 실전 처리량을 끌어올렸다. 이 설계로 OmniDocBench v1.6에서 94.91%의 정확도와 최대 4,752 TPS를 달성했으며 처리량 이득은 문서 길이가 길수록 더 크게 나타났다. 다만 병렬 디코딩 전환을 위한 staged adaptation과 난이도 인지 데이터 큐레이션 절차가 필요하므로 훈련 파이프라인과 런타임 통합이 배포의 핵심 요소로 남아 있다.
핵심 역량
- 단일 페이지 문서를 분석해 전역 레이아웃 구조를 추출하고 해당 구조에 따라 지역별 텍스트를 병렬로 생성할 수 있다. 이 과정에서 부모 레이아웃 브랜치가 자식 브랜치의 시작을 동적으로 포킹하여 지역 생성 작업을 분산 처리한다. 최종 출력은 자식 브랜치들을 순서대로 스플라이스하여 단일 문서 시퀀스로 재조합한다.
- P-MTP(Progressive Multi-Token Prediction)를 통해 각 자식 브랜치 내부에서 한 번의 반복으로 다수의 미래 토큰 초안을 생성하고 검증하여 디코딩 반복 수를 줄일 수 있다. 이 기법은 speculative decoding 워크플로와 함께 동작하며 검증 단계에서 원래의 autoregressive 출력과 일치성을 유지하도록 설계되었다. 결과적으로 동일한 출력 품질을 유지하면서 디코딩 스텝과 지연을 줄였다.
- vLLM의 맞춤된 런타임을 사용하면 페이지 단위의 동적 포킹과 제로복사(prefix) KV 재사용으로 실제 병렬 브랜치가 메모리 중복 없이 동작하게 할 수 있다. 트래픽이 큰 배치에서 높은 TPS를 유지하도록 설계되어 대량 문서 처리에 적합하다. transformers 경로는 단일 배치, 단일 이미지 재현용으로 제공되어 실험적·개발용으로 이용할 수 있다.
강점
- 동일한 unified 파서 계열에서 1B라는 소형 모델 크기에도 OmniDocBench v1.6에서 94.91%라는 최고 성능을 기록하여 파라미터-성능 효율이 우수하다는 점이 확인됐다. 모델은 동적 타일링과 공유 접두사 KV 캐시 재사용으로 긴 입력 토큰 예산(약 4,800 토큰/페이지)을 처리하면서도 높은 정확도를 유지했다. vLLM 맞춤 런타임을 통해 대규모 배치에서 4,752 TPS라는 실전 수준의 처리량을 달성했다.
훈련 방식
InternVL3.5-1B를 기반으로 staged adaptation 기법과 난이도 인지 데이터 큐레이션을 통해 기존 autoregressive 파서의 능력을 계층적 병렬 디코딩으로 이전시켰으며 P-MTP 가중치를 포함한 미세조정 절차를 통해 출력 일관성을 유지했다.
알아두면 좋은 것
- HPD-Parsing은 InternVL3.5-1B를 백본으로 사용하고 동적 타일 기반 크롭핑(max 24 tiles, 448×448)을 도입하여 고해상도 문서 세부를 보존했다. P-MTP 관련 가중치는 체크포인트 내부에 포함되며 load_mtp_weights()로 로드할 수 있다. vLLM 경로는 speculative decoding과 포킹을 지원하도록 맞춤 빌드가 제공된다.
- 학습 측면에서는 staged adaptation과 자동 난이도 인식 기반 데이터 큐레이션을 통해 전통적 autoregressive 파서에서 병렬 디코딩 패러다임으로 전환하는 동안 정확도 저하를 최소화했다. 데이터 파이프라인은 대규모 수집, 모델 보조 어노테이션, 난이도 추정, 균형 샘플링을 포함한다. 이 과정은 수동 레이블링 부담을 줄이며 어려운 샘플에 초점을 맞춘다.
- 공개 리포지토리와 데모가 제공되며 Docker 이미지를 통해 vLLM 기반 서버를 즉시 기동할 수 있다. transformers 경로는 generate_hpd(...) API로 동일한 디코딩 로직을 단일 이미지 환경에서 재현할 수 있다. 평가 스크립트(eval/)는 TPS 측정과 OmniDocBench v1.6 정확도 재생산을 지원한다.
기술적 특징
- 계층적 병렬 디코딩은 전역 레이아웃 브랜치가 문서 구조를 먼저 결정하고, 해당 구조에 따라 여러 지역 단위의 콘텐츠 브랜치를 동적으로 생성하여 병렬로 텍스트를 생성하게 한다. 이 설계는 문서 레이아웃과 지역 콘텐츠의 상이한 의존성 패턴을 분리하여 전역적 조정과 지역적 생성 작업을 병렬로 수행함으로써 전체 디코딩의 순차 길이를 단축시킨다. 결과적으로 긴 문서에서 발생하는 토큰 의존성 병목을 크게 완화했다.
- P-MTP는 각 브랜치 내에서 한 번의 반복으로 여러 미래 토큰을 예측하는 기법이며 speculative decoding과 결합되어 초안 토큰을 제안하고 그 제안을 검증하는 방식으로 동작한다. 모델은 P-MTP 가중치를 별도로 포함하거나 로드하도록 설계되어 있으며 greedy verification을 통해 출력의 일관성을 보장한다. 이로 인해 브랜치 내부의 디코딩 스텝 수가 감소하여 전체 연산량과 지연이 줄어든다.
- 공유 접두사 KV 캐시 재사용은 부모 레이아웃 브랜치가 생성한 KV를 자식 브랜치들이 복제 없이 참조하도록 하여 메모리와 연산의 중복을 피한다. vLLM 맞춤 빌드에서는 true concurrent branching이 가능한 페이지 단위 포킹과 zero-copy prefix sharing을 구현하여 실제 병렬성에서 이득을 얻었다. transformers 경로에서는 batch_children 옵션을 통해 메모리-성능 트레이드오프를 선택할 수 있다.
- 동적 타일 기반 크롭핑은 최대 24개의 448×448 타일로 고해상도 페이지를 분할하여 백본의 입력 해상도를 보존하면서도 처리 가능한 입력 크기로 조정한다. 이 전처리 파이프라인은 InternVL 경로와 일치하도록 설계되어 세부 인식 성능을 확보한다. 타일링과 병렬 브랜치의 결합이 긴 문서에서의 정밀도와 처리량을 동시에 끌어올리는 핵심 요소였다.
차별점
- 동일 unified VLM 파서 계열에서 1B 크기로 OmniDocBench v1.6에서 94.91%를 기록하여 동급 대비 파라미터 효율성이 뛰어나다. HPD-Parsing은 계층적 병렬 디코딩과 P-MTP를 결합해 처리량-정확도 트레이드오프를 개선했다. vLLM 맞춤 런타임과의 통합으로 대규모 배치에서 실전 수준의 TPS를 확보했다.
- P-MTP 가중치를 체크포인트 내부에 포함하고 자동 로딩 인터페이스(model.load_mtp_weights)를 제공하여 연구·제품 전환 시 적용 편의성을 높였다. transformers 경로에서도 generate_hpd API로 동일한 디코딩 루틴을 재현할 수 있어 개발·검증 환경을 지원한다. Docker 이미지와 데모가 제공되어 배포와 테스트가 용이하다.
- 난이도 인지 데이터 큐레이션과 staged adaptation을 통해 병렬 디코딩으로의 전환 시 발생할 수 있는 정확도 저하를 최소화하는 훈련 파이프라인을 적용했다. 자동화된 난이도 추정과 균형 샘플링이 고난도 사례에 초점을 맞춰 성능 하락 없이 새로운 디코딩 패러다임을 학습하게 했다. 이로 인해 병렬화에 따른 품질 손실을 낮추면서 효율을 확보했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| OmniDocBench v1.6 | Overall Accuracy | 94.91% | state-of-the-art among end-to-end unified parsers |
| Throughput (vLLM, A800 80GB, BS=512) | TPS | 4,752.1 | 2.62× fastest existing parser; 3.06× autoregressive baseline |
| PPS (vLLM, A800 80GB, BS=512) | PPS | 2.68 | Improved from 1.02 to 2.68 PPS on same setup |
이미지 분석



74
Likes
1.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.