본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Tencent-Hunyuan/HunyuanOCR

Python3 / 0

DFlash 추론 가속과 PC용 llama.cpp 배포를 지원하는 경량 엔드투엔드 OCR VLM이다.

TL;DR

경량 end-to-end OCR용 VLM인 HunyuanOCR-1.5는 기존 백본을 유지하면서 DFlash speculative-decoding으로 긴 구조화 출력의 디코딩 병목을 줄이고 GGUF 변환과 llama.cpp를 통해 PC/랩탑 배포 경로를 제공한다. 에이전트 기반의 Agentic Data Flow와 업그레이드된 학습 레시피를 결합하여 저자원 OCR, 고대 문자, 다중 이미지 QA 등 장기 꼬리 능력을 보강하고 사전학습 시 최대 4K 해상도와 128K 컨텍스트를 지원한다. 배포는 vLLM·transformers·llama.cpp의 세 가지 상호 배타적 환경을 제공하여 서버와 로컬 양쪽 시나리오를 커버하지만 vLLM과 native transformers는 동일 환경에서 공존하지 않으므로 환경 분리와 버전 관리를 필요로 한다. 이 저장소는 SFT 및 DFlash 학습 파이프라인과 inferencing 예시를 공개하여 재현과 도메인 적응을 가능하게 한다. 최종적으로 긴 문서·표 중심의 OCR 워크로드에서 추론 지연을 줄이고 데스크톱 환경까지 배포 범위를 확장하는 데 초점을 맞추고 있다.

핵심 포인트

  • DFlash 기반의 추정-검증 워크플로를 도입하여 긴 구조화 출력에서 원본 모델의 출력 분포를 유지하면서 디코딩 지연을 절감한다. 블록-디퓨전 초안이 병렬로 여러 후보를 생성하고 대상 모델이 이를 검증하는 구조는 전통적 순차 토큰 예측과 달리 병목을 감소시킨다. 이 구성은 문서 파싱, 테이블 파싱, 긴 텍스트 생성에서 응답 지연을 크게 낮출 수 있도록 설계되었다.
  • PC 사이드 배포를 위한 GGUF 변환과 DFlash 적응 llama.cpp 포크를 함께 제공하여 데스크톱 환경에서도 가속을 활용할 수 있다. 표준 community llama.cpp 빌드와 DFlash-adapted 포크 모두 예시 스크립트와 변환 도구가 포함되어 있다. 이로 인해 클라우드 서버가 아닌 환경에서도 일관된 추론 파이프라인을 유지할 수 있다.
  • Agentic Data Flow를 통해 데이터 수집·검증·정제 과정에 에이전트를 깊게 통합하여 장기적 약점 보강을 자동화한다. 에이전트는 자료 검색, 툴 기반 검사, 샘플 클리닝, 파이프라인 개발에 반복적으로 참여하며 생성된 데이터는 Stage-3 사전학습과 후처리 SFT에 반영된다. 이 접근은 고대 문자, 저자원 언어, 멀티이미지 QA 같은 특정 능력을 표적 강화하는 데 초점을 맞춘다.
  • DFlash 추론 가속을 적용하여 긴 구조화 출력의 디코딩 지연을 줄인다. 이 방식은 블록-단위 초안 모델이 병렬로 후보 토큰을 생성하고 대상 모델이 단일 검증 패스로 이를 확인하는 구조로 동작한다. 결과적으로 긴 문서나 표에서 순차적 토크나이즈 병목을 완화시키도록 설계되었다.

이미지 분석

HunyuanOCR-1.5의 시스템 구성과 적용 사례를 요약한 다이어그램으로, 모델 구성 요소와 적용 가능한 OCR 태스크 예시를 시각화하고 있다.
이미지는 Native Resolution VE와 Adaptive MLP Connector로 시각 토큰을 LLM에 연결하는 전체 아키텍처 흐름을 보여주며, DFlash speculative decoding과 PC-side llama.cpp 배포 등 주요 구성 요소의 관계를 시각적으로 정리한다. 우측에는 문서 파싱, 텍스트 스포팅, 차트 파싱, 고문자 인식 등 실제 적용 예시가 배치되어 있어 모델의 범용성과 처리 가능한 입력 유형을 한눈에 확인할 수 있다.

1.9k

STARS

139

FORKS

+204

TRENDING

3

조회수

watchers 1.9kopen issues 75Other

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.