본문으로 건너뛰기

128K 컨텍스트를 넘어선 장기 비전-언어 모델의 일반화와 효과적 LongPT 학습

긴 컨텍스트를 다루는 LVLM의 능력은 문서 이해, 비디오 분석, 에이전트 워크플로에서 핵심적이다. 본 연구는 32K에서 128K로 컨텍스트를 확장하는 LongPT를 체계적으로 분석하고, 데이터 구성과 혼합 전략이 성능 및 일반화에 미치는 영향을 실증한다.

용어 해설

LongPT
긴 컨텍스트 멀티모달 학습 신호를 생성하는 지속적(pre-training) 학습 프레임워크로, 32K에서 128K 컨텍스트로 확장하는 방법과 데이터 구성 전략을 포함한다.
긴 문서 VQA(Long-Document VQA)
긴 문서에서 정보를 추출하고 수치 추론을 수행하도록 설계된 비주얼-퀘스처-응답 학습 신호이며, 다중 페이지 간 증거를 요구한다.
mRoPE(로터리 포지션 인코딩)(mRoPE)
롱 컨텍스트 확장을 위한 위치 인코딩 기법으로, 컨텍스트 길이가 늘어나도 토큰 위치 정보를 효과적으로 표현하도록 설계된 회전 인코딩의 변형이다.
OCR 전사(OCR Transcription)
긴 문서의 페이지를 이미지로 보고 텍스트를 전사하도록 학습하여 긴 이미지-텍스트 의존성을 모델링하는 방법.
MM-NIAH
웹페이지 기반의 검색-추출-추론을 평가하는 멀티모달 니들-인-헤이스트 벤치마크.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 13.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.