본문으로 건너뛰기
HF Daily Papers조회 1

병렬 토큰 예측을 통한 효율적인 문서 파싱

기존 시각-언어 모델(VLM)은 문서를 한 글자씩 순차적으로 읽어 처리 속도가 매우 느렸으나, 이 논문은 여러 토큰을 동시에 예측하는 병렬 방식을 도입해 속도를 2배 이상 높였다. 이는 대규모 문서 처리 비용을 절감할 뿐만 아니라 모델이 문맥을 더 넓게 파악하게 하여 오답(환각)을 줄이는 효과도 제공한다.

용어 해설

자기회귀 디코딩(Autoregressive Decoding)
이전 단계에서 생성된 토큰을 다음 단계의 입력으로 사용하는 순차적 생성 방식이다. 한 번에 하나의 토큰만 처리할 수 있어 시퀀스가 길어질수록 추론 시간이 선형적으로 증가하는 단점이 있다.
KV 캐시(KV Cache)
Transformer 모델에서 이전 토큰들의 Key와 Value 행렬을 메모리에 저장해두는 기술이다. 매번 처음부터 다시 계산하는 낭비를 줄여 추론 속도를 높이지만, 메모리 사용량이 늘어나는 트레이드오프가 있다.
환각 현상(Hallucination)
모델이 실제 데이터에 없는 내용을 사실인 것처럼 그럴듯하게 생성하는 현상이다. OCR 작업에서는 이미지에 없는 글자를 지어내거나 잘못 읽는 형태로 나타나며 신뢰성을 저해하는 주요 요인이다.
추측 디코딩(Speculative Decoding)
작고 빠른 모델이 미리 여러 토큰을 예측하고 큰 모델이 이를 한꺼번에 검증하는 방식이다. 검증이 성공하면 여러 토큰을 한 번에 확정할 수 있어 전체적인 생성 속도가 빨라진다.
인과적 어텐션 마스크(Causal Attention Mask)
Transformer 모델에서 특정 토큰이 미래에 올 토큰을 참조하지 못하도록 가리는 행렬이다. 이를 통해 모델이 정답을 미리 보고 학습하는 것을 방지하며, 실제 생성 시에도 이전 정보만을 바탕으로 다음 단어를 예측하게 만든다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 16.수집 2026. 03. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.