TL;DR
긴 구조화 텍스트를 포함한 문서 처리에서는 토큰별 순차 디코딩이 전체 지연의 주요 원인이며 서비스 배포 비용과 응답 시간을 악화시켰다. HunyuanOCR-1.5는 병렬 블록 초안과 대상 모델의 일괄 검증을 결합하여 디코딩 횟수를 줄였고, 이로 인해 실환경에서의 처리 지연과 비용이 동시에 개선될 가능성이 커졌다. 또한 에이전트 기반 데이터 파이프라인을 통해 장기 문서, 고유문자, 다중 페이지 질의응답 등 기존 모델의 롱테일 약점을 체계적으로 보완해 실제 적용 범위를 확장했다.
왜 중요한가
긴 구조화 텍스트를 포함한 문서 처리에서는 토큰별 순차 디코딩이 전체 지연의 주요 원인이며 서비스 배포 비용과 응답 시간을 악화시켰다. HunyuanOCR-1.5는 병렬 블록 초안과 대상 모델의 일괄 검증을 결합하여 디코딩 횟수를 줄였고, 이로 인해 실환경에서의 처리 지연과 비용이 동시에 개선될 가능성이 커졌다. 또한 에이전트 기반 데이터 파이프라인을 통해 장기 문서, 고유문자, 다중 페이지 질의응답 등 기존 모델의 롱테일 약점을 체계적으로 보완해 실제 적용 범위를 확장했다.
핵심 기여
DFlash 기반 병렬 드래프트를 OCR 디코딩에 적용해 대규모 속도 개선을 달성
HunyuanOCR-1.5는 DFlash 블록-디퓨전 초안 모델을 도입해 대상 모델의 히든 상태를 조건으로 블록 단위 후보를 병렬 생성하고 단일 검증으로 유효 접두사를 확정했다. 구현상 초안 모델은 약 90.7M 파라미터, 블록 크기 B=16, 앵커 수 n=16, γ=7.0의 설정을 사용해 학습되었다. 이 방식은 Transformer 환경에서 6.37배, vLLM 환경에서 2.14배의 평균 추론 속도 향상을 보고했다.
Agentic Data Flow로 장기·롱테일 능력 확장을 자동화한 데이터 파이프라인
Agentic Data Flow는 모델의 약점을 실행 가능한 데이터 수요로 전환하고 웹 수집, 폰트/배경 검증, 합성 파이프라인 개발을 에이전트가 도맡아 반복적으로 수행하는 체계다. 이 시스템은 저자원 다국어, 고문자(ancient-script), 다중 이미지 QA 등 장기 능력 데이터를 자동으로 생성하고 품질 기준에 따라 정제했다. 반복적인 인간-에이전트 검증 루프를 통해 효율적으로 롱테일 케이스를 확보했다.
해상도와 컨텍스트 확장 및 능력 지향적 학습 레시피로 모델 성능 한계 상향
프리트레이닝 Stage3를 재구성하여 4K 입력 해상도와 128K 컨텍스트 윈도우를 도입했고, 에이전트 생성 데이터를 포함해 모델이 고해상도·다중 페이지·긴 구조화 출력을 처리하도록 적응시켰다. SFT에서는 데이터 정제와 통일된 프롬프트 인터페이스로 기반을 마련한 뒤, RL 단계에서 능력 중심 보상(구조적 사실성, 일관성 판정, 생성 퇴화 억제)을 사용해 상한 성능을 추가로 끌어올렸다. 이 파이프라인은 다양한 OCR 서브태스크에서 성능 보존과 경계 확장을 동시에 달성했다.
능력 중심 평가 트리와 여러 벤치마크에서 경계 성능 확보
단일 벤치가 아닌 능력 분류 방식의 평가 트리를 설계해 기본 OCR, 롱테일 확장, 구조 요소 파싱, 다중 페이지 이해, 신뢰성 등 여러 축에서 성능을 측정했다. HunyuanOCR-1.5는 OmniDocBench v1.6에서 Overall 94.74를 기록했고 TableVerse-5K에서 TEDS 78.23을 달성했으며 Chronicles-OCR와 ChartArena 등 경계 영역에서 경쟁력 있는 결과를 보였다. 모델 가중치와 학습 코드를 공개해 재현성과 확산을 지원할 계획이다.
핵심 아이디어 이해하기
문서·차트·표처럼 긴 구조화 텍스트를 생성하는 OCR 작업에서는 자동회귀 디코딩이 토큰 하나당 대상 모델의 순차적인 전방 전달을 요구하므로 출력 길이에 따라 지연이 기하급수적으로 증가한다. 이 논문은 디코딩 병목을 해소하기 위해 별도의 경량 초안 모델이 대상 모델의 히든 상태를 조건으로 블록 단위 후보를 병렬 생성하고, 대상 모델이 해당 블록을 한 번에 검증해 유효 접두사를 확정하도록 설계했다. 이렇게 하면 동일한 전력 소모 내에서 각 대상 모델 전방 전달로 전진할 수 있는 토큰 수가 증가해 긴 구조화 출력에서 실질적 지연을 크게 줄인다.
관련 Figure

그림은 각 드래프트 블록이 앵커 이전의 타깃 히든 상태에만 접근하고 블록 내 마스크 토큰에 대해 비인과(non-causal) 주의를 허용하는 마스크 패턴을 보여준다. 이 시각자료는 DFlash가 어떻게 여러 블록을 한 번의 전달로 학습하되 서로 간섭하지 않도록 구조를 설계했는지를 구체적으로 드러낸다. 또한 병렬 드래프팅이 대상 모델의 일괄 검증 단계와 결합되어 디코딩 횟수를 줄이는 동작 원리를 명확히 한다.
DFlash 학습에서 블록-대각 FlexAttention 마스크 구조와 여러 앵커에 대한 병렬 블록 드래프팅 과정을 행렬 형태로 시각화한 그림이다.
방법론
전체 아키텍처는 원본 HunyuanOCR의 경량 엔드투엔드 설계를 유지하면서 시각 인코더의 최대 입력 해상도를 2K에서 4K로 확장했다. 시각 특징은 adaptive MLP connector로 압축되어 레이아웃 민감성을 보존한 채 언어 모델(Hunyuan-0.5B, XD-RoPE)에 연결되며, 언어 모델은 autoregressive 방식으로 구조화된 OCR 출력을 생성한다. DFlash 관련 구현에서는 대상 모델을 고정하고 초안 모델만 학습했으며, 각 시퀀스에 대해 대상 모델 전방 전달로 얻은 히든 상태를 캐시해 n개의 무작위 앵커를 샘플링하고 FlexAttention 블록-대각 마스크로 다중 블록을 한 번에 처리했다. 초안 손실은 위치 가중 차기 토큰 교차 엔트로피로 정의되며 가중치는 지수 감쇠로 먼 위치의 난이도를 반영하도록 설계되었다. 데이터 측면에서는 Agentic Data Flow가 자료 수집, 도구 기반 정제, 합성 파이프라인 생성 및 인간-에이전트 반복을 수행해 저자원 언어, 고문자, 다중 이미지 QA 등의 훈련 데이터를 자동으로 생성했다. 학습 레시피는 재계획된 Stage3 프리트레이닝(에이전트 데이터·다중 이미지·히스토리컬 OCR 포함), 고품질 SFT 데이터와 능력 중심 RL을 연속적으로 적용하는 방식으로 구성되었다. RL 단계에서는 IcePop이라는 GRPO 계열 최적화와 토큰 수준 보정 비율을 사용해 train–inference 불일치를 완화하며, 문서 파싱을 위한 구조적·요소별 보상, QA를 위한 LLM-판사 기반 일관성 보상, 생성 퇴화를 억제하는 길이·반복 패널티를 결합해 정밀한 보상 신호를 제공했다.
관련 Figure

다이어그램은 4K 입력을 처리하는 시각 인코더가 레이아웃 민감한 특징을 adaptive MLP로 축약해 언어 모델로 전달하는 파이프라인을 시각적으로 표시한다. 오른쪽 그림은 본 모델이 문서 파싱, 텍스트 스팟팅, 표·차트 파싱, 고문자 인식, 이미지 번역 등 다양한 OCR 업무를 단일 모델로 처리하도록 설계되었음을 보여준다. 이 이미지는 모델 설계의 핵심인 해상도 확장과 백본 유지 전략이 어떻게 다양한 태스크를 통합하는지를 보강한다.
HunyuanOCR-1.5의 전체 아키텍처 다이어그램으로 네이티브 해상도 비주얼 인코더, adaptive MLP 커넥터, 경량 언어 모델로 구성된 엔드투엔드 흐름을 제시한다.

이미지는 에이전트가 자료 검색·정리, 도구 기반 정제, 파이프라인 개발과 반복 검증을 수행해 재사용 가능한 데이터 생산 흐름을 형성하는 단계를 단계별로 제시한다. 각 하위 작업은 자동화된 도구 호출과 알고리즘 엔지니어의 피드백 루프를 통해 고품질 합성 데이터와 하드 케이스를 확보하는 방식으로 설명되어 있다. 이 그림은 데이터 측면에서 능력 경계 확장이 단순한 규모 확장이 아니라 약점 지향적 데이터 파이프라인 설계임을 보강한다.
Agentic Data Flow의 워크플로와 세 가지 능력 확장 태스크(저자원 OCR, 고문자 데이터 구축, 다중 이미지 QA)를 연결한 파이프라인 그림이다.
주요 결과
DFlash 적용 결과 Transformer 환경에서 평균 추론 속도가 6.37배 향상되었고 vLLM 환경에서는 2.14배 향상이 관측되었다. OmniDocBench v1.6에서는 HunyuanOCR-1.5가 Overall 94.74를 기록해 경량 엔드투엔드 계열에서 최고 수준의 문서 파싱 성능을 달성했다. 능력 경계 시험에서는 Chronicles-OCR의 고문자 인식에서 아카이브와 성숙 스크립트 평균이 각각 0.54와 0.79 수준을 보였고 TableVerse-5K에서는 TEDS 78.23, CHAOS-Bench의 페이지 평균 리콜은 14.15를 기록해 환각 억제 측면에서 기존 모델 대비 향상이 확인되었다. 또한 다중 이미지 QA, 차트 디플로팅, 저자원 다국어 파싱 등의 하위 벤치에서 유의미한 성능 증가를 보여 전반적 능력 확장과 실제 배포 효용이 동시에 확보되었다.
기술 상세
아키텍처 구성은 네이티브 해상도 시각 인코더(Hunyuan-ViT 기반, 4K 입력 지원), adaptive MLP connector, 그리고 경량 언어 모델(Hunyuan-0.5B, XD-RoPE)으로 이루어져 입력 해상도 확장에도 백본 재설계 없이 고해상도 문서의 공간 정보를 보존하도록 설계되었다. DFlash 초안 모델은 약 90.7M 파라미터, 5개 레이어 Transformer 기반으로 구성되며 블록 크기 B=16과 앵커 수 n=16을 사용해 훈련되었다. 훈련 중 대상 모델은 고정하고 한 번의 대상 전방 전달로 얻은 히든 상태를 조건으로 다수의 블록 드래프트를 FlexAttention 블록-대각 마스크로 병합해 효율적으로 학습했다. RL 최적화는 IcePop이라는 GRPO 계열 방식으로 토큰 수준 보정 비율과 마스킹을 적용해 train–inference 불일치를 억제하며, 손실은 토큰 단위 정책 그래디언트와 KL 페널티를 결합한 형태로 계산되었다. 문서 파싱 보상은 평문 텍스트에 대한 정규화된 편집거리 기반 보상과 표·차트 같은 특수 요소에 대한 요소별 보상을 결합했고, 표 요소는 내용 보상(R_content)과 구조 보상(R_struct)을 0.5씩 혼합해 산출했다. 차트 보상은 예측과 레퍼런스를 CSV 형태로 정규화한 뒤 SCRM(mAP) 기반으로 평균 AP를 계산해 순서 불변성 문제를 회피했다. 과생성 억제 측면에서는 태스크별 출력 길이 상한을 설정해 초과 시 보상을 0으로 부여하고 연속 반복 단위 패턴을 탐지해 반복이 감지되면 보상을 0으로 처리하는 규칙을 적용했다.
관련 Figure

이 이미지는 각 보상 구성요소가 타깃 능력(문서 사실성, QA 일관성, 안정적 생성)에 어떻게 대응하는지를 흐름으로 연결해 보상 설계의 목적성과 적용 방식을 보여준다. 문서 파싱 보상은 평문과 구조요소 별 보상을 혼합해 구조적 정확성을 확보하고, QA 보상은 LLM 판사로 일관성을 판정하며, 퇴화 억제는 길이와 반복성 규칙으로 위험 출력을 차단하는 점을 명확히 한다. 보상 도식은 RL 단계에서의 정밀한 최적화 신호 설계가 모델 신뢰성 향상에 핵심임을 뒷받침한다.
강화학습 보상 설계의 개요로 문서 파싱용 사실성 보상, 일반 QA용 일관성 판정 보상, 생성 퇴화 억제 보상 세 가지 구성 요소를 도식화한 그림이다.
한계점
CHAOS-Bench 결과에서 페이지 평균 리콜이 14.15에 그쳐 시각적으로 관찰된 비의미적 또는 변형된 단어를 완전히 보존하는 것은 여전히 어려운 문제로 남아 있다. DFlash 기반 병렬 초안은 구조화 출력과 국소적 규칙성이 강한 경우 효과가 크지만 짧거나 예측이 어려운 출력에서는 고정 오버헤드 때문에 이득이 제한되었다. 에이전트 기반 데이터 파이프라인은 자동 수집과 정제의 효율을 높였으나 특정 언어·문자 폰트의 합성 품질이나 실제 촬영 노이즈 분포를 완전히 대체하지 못할 수 있어 수동 검증이 여전히 필요하다.
실무 활용
HunyuanOCR-1.5는 서버급 vLLM 환경과 로컬 PC용 llama.cpp 양쪽을 지원해 배포 유연성을 확보했다. DFlash 기반 병렬 초안은 단일 요청 또는 저동시성 환경에서 특히 디코딩 지연을 줄여 응답성을 요구하는 실서비스에 적합하다. 에이전트 중심 데이터 파이프라인은 도메인별 희귀 사례를 자동으로 보강해 산업용 문서 파이프라인에 직접 투입 가능한 데이터 자산을 제공한다.
- 대규모 문서 아카이브의 고해상도 스캔을 빠르게 구조화해 색인과 검색 파이프라인에 투입하는 전처리 엔진
- 금융·법률 문서에서 복잡한 표와 수식의 정확한 구조 복원을 요구하는 자동화된 문서 변환 워크플로
- 현지화가 어려운 저자원 언어·고문자 문서의 대규모 전사 및 후처리용 학습 데이터 생성 파이프라인
코드 공개 여부: 미확인
키워드
용어 해설
- Speculative Decoding
- — 추측적 디코딩은 경량 초안 모델이 다수의 후보 토큰 블록을 병렬로 제안하고 대상 모델이 한 번의 검증으로 유효한 접두사를 확정하는 방식이다. 이 방법은 순차적 토큰 생성을 줄여 긴 구조화 출력에서 디코딩 지연을 낮추는 데 핵심 역할을 한다. HunyuanOCR-1.5에서는 DFlash 기반 병렬 초안이 이 원리로 디코딩 효율을 크게 개선했다.
- Block Diffusion
- — 블록 확산은 연속 토큰 블록을 한 번에 예측하도록 설계된 생성 기법으로, 각 블록은 마스크 토큰 쿼리로 조건화되어 병렬로 샘플링된다. 이 접근은 DFlash처럼 초안 모델이 블록 단위 출력을 생성하고 대상 모델이 병렬 검증을 수행하는 워크플로에서 사용된다. OCR의 긴 구조화 출력에서 디코딩 횟수를 줄여 처리량을 높이는 데 중요하다.
- FlexAttention
- — FlexAttention은 블록-대각 마스크 등 유연한 어텐션 패턴을 허용하는 메커니즘으로, 서로 독립적인 드래프트 블록이 조건 히든 상태와 같은 블록 내 마스크 토큰에만 주의를 기울이도록 제어한다. DFlash 훈련에서 여러 블록을 하나의 전달로 묶어 학습할 때 블록 간 독립성을 보장하는 역할을 한다. 이로 인해 병렬 블록 예측의 학습 효율과 안정성이 확보된다.
- TEDS
- — TEDS는 표 구조 및 내용 복원을 평가하기 위한 지표로서 문자 수준 편집거리와 구조적 매칭을 혼합하여 점수를 산출한다. HunyuanOCR-1.5의 보상 설계에서는 TEDS의 단점을 보완해 구조적 보상과 내용 보상을 분리하여 안정적인 학습 신호로 활용했다. 표 파싱 정확도와 구조적 일치성을 세밀하게 측정하는 데 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.