본문으로 건너뛰기
HF Daily Papers조회 1

MinerU2.5-Pro: 데이터 중심 설계를 통한 대규모 문서 파싱의 한계 돌파

모델 구조를 전혀 바꾸지 않고 오직 학습 데이터의 품질과 학습 전략만 개선하여 세계 최고의 문서 파싱 성능을 달성했다. 이는 복잡한 표나 수식이 포함된 PDF를 텍스트로 변환할 때 발생하는 고질적인 오류를 데이터 엔지니어링만으로 해결할 수 있음을 증명한 사례이다.

용어 해설

문서 파싱(Document Parsing)
PDF나 이미지 형태의 비정형 문서를 Markdown이나 HTML 같은 기계 읽기 가능한 구조적 형식으로 변환하는 기술이다. 텍스트 추출뿐 아니라 표, 수식, 레이아웃 등 시각적 구조를 보존하는 것이 핵심이다.
데이터 중심 AI(Data-Centric AI)
모델 아키텍처를 고정한 상태에서 학습 데이터의 품질과 다양성을 체계적으로 개선하여 성능을 높이는 접근 방식이다. 모델 코드 수정보다 데이터 엔지니어링에 집중하여 성능 병목을 해결한다.
그룹 상대 정책 최적화(GRPO)
별도의 보상 모델 없이 그룹 내 샘플들의 상대적 점수를 비교하여 모델을 최적화하는 강화학습 기법이다. 계산 효율성이 높으며 모델의 출력 형식을 특정 벤치마크 지표에 맞게 정렬하는 데 효과적이다.
지도 미세 조정(SFT)
사람이 작성하거나 검증한 고품질 정답 데이터를 사용하여 모델을 특정 작업에 맞게 학습시키는 과정이다. 모델이 도메인 지식을 습득하고 원하는 출력 형식을 배우는 기초 단계가 된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 06.수집 2026. 04. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.