Tencent-Hunyuan/HunyuanOCR
Python3 / 0
DFlash 추론 가속과 PC용 llama.cpp 배포를 지원하는 경량 엔드투엔드 OCR VLM이다.
TL;DR
경량 end-to-end OCR용 VLM인 HunyuanOCR-1.5는 기존 백본을 유지하면서 DFlash speculative-decoding으로 긴 구조화 출력의 디코딩 병목을 줄이고 GGUF 변환과 llama.cpp를 통해 PC/랩탑 배포 경로를 제공한다. 에이전트 기반의 Agentic Data Flow와 업그레이드된 학습 레시피를 결합하여 저자원 OCR, 고대 문자, 다중 이미지 QA 등 장기 꼬리 능력을 보강하고 사전학습 시 최대 4K 해상도와 128K 컨텍스트를 지원한다. 배포는 vLLM·transformers·llama.cpp의 세 가지 상호 배타적 환경을 제공하여 서버와 로컬 양쪽 시나리오를 커버하지만 vLLM과 native transformers는 동일 환경에서 공존하지 않으므로 환경 분리와 버전 관리를 필요로 한다. 이 저장소는 SFT 및 DFlash 학습 파이프라인과 inferencing 예시를 공개하여 재현과 도메인 적응을 가능하게 한다. 최종적으로 긴 문서·표 중심의 OCR 워크로드에서 추론 지연을 줄이고 데스크톱 환경까지 배포 범위를 확장하는 데 초점을 맞추고 있다.
핵심 포인트
- DFlash 기반의 추정-검증 워크플로를 도입하여 긴 구조화 출력에서 원본 모델의 출력 분포를 유지하면서 디코딩 지연을 절감한다. 블록-디퓨전 초안이 병렬로 여러 후보를 생성하고 대상 모델이 이를 검증하는 구조는 전통적 순차 토큰 예측과 달리 병목을 감소시킨다. 이 구성은 문서 파싱, 테이블 파싱, 긴 텍스트 생성에서 응답 지연을 크게 낮출 수 있도록 설계되었다.
- PC 사이드 배포를 위한 GGUF 변환과 DFlash 적응 llama.cpp 포크를 함께 제공하여 데스크톱 환경에서도 가속을 활용할 수 있다. 표준 community llama.cpp 빌드와 DFlash-adapted 포크 모두 예시 스크립트와 변환 도구가 포함되어 있다. 이로 인해 클라우드 서버가 아닌 환경에서도 일관된 추론 파이프라인을 유지할 수 있다.
- Agentic Data Flow를 통해 데이터 수집·검증·정제 과정에 에이전트를 깊게 통합하여 장기적 약점 보강을 자동화한다. 에이전트는 자료 검색, 툴 기반 검사, 샘플 클리닝, 파이프라인 개발에 반복적으로 참여하며 생성된 데이터는 Stage-3 사전학습과 후처리 SFT에 반영된다. 이 접근은 고대 문자, 저자원 언어, 멀티이미지 QA 같은 특정 능력을 표적 강화하는 데 초점을 맞춘다.
- DFlash 추론 가속을 적용하여 긴 구조화 출력의 디코딩 지연을 줄인다. 이 방식은 블록-단위 초안 모델이 병렬로 후보 토큰을 생성하고 대상 모델이 단일 검증 패스로 이를 확인하는 구조로 동작한다. 결과적으로 긴 문서나 표에서 순차적 토크나이즈 병목을 완화시키도록 설계되었다.
이미지 분석

1.9k
STARS
139
FORKS
+204
TRENDING
3
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.