본문으로 건너뛰기

PARSER, 긴 문서를 병렬로 읽는 LLM 에이전트

PARSER는 문서 청크를 병렬로 읽고 리드 에이전트가 반복 추론해 긴 문맥 정확도와 지연 시간을 함께 개선합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

긴 문서를 순서대로 읽는 메모리 에이전트는 문서 탐색 단계와 추론 깊이가 묶여 증거 위치에 따라 정확도가 흔들리고 문서 길이에 비례해 지연 시간이 늘어납니다. PARSER는 각 청크를 전담하는 고정 하위 에이전트가 문서 전체를 병렬로 읽게 하고, 리드 에이전트가 모든 하위 에이전트에 질의를 보내 응답을 모은 뒤 후속 질의를 반복 생성하는 scatter-gather 구조를 사용합니다. 학습 가능한 부분은 강화학습으로 최적화한 리드 에이전트에 집중되며 하위 에이전트는 별도 학습 없이 유지됩니다. 7K에서 896K 토큰까지의 다중 추론 질의응답에서 4B PARSER는 순차 메모리 기준선보다 평균 5.7포인트, 896K 토큰에서는 12.0포인트 높았고, 9B 구성은 DeepSeek-V4-Pro보다 6.3포인트 앞섰으며 추론 지연 시간은 최대 11배 줄었습니다.

섹션별 상세

01
순차 메모리 에이전트는 문서 청크를 하나씩 읽으며 압축된 상태를 갱신하기 때문에 문서 이동 횟수와 추론 깊이가 서로 묶입니다. 이 구조에서는 정답에 필요한 증거가 문서의 어느 위치와 순서에 놓였는지에 따라 정확도가 크게 달라지고, 문서 길이가 늘어날수록 추론 지연 시간도 선형적으로 증가합니다. PARSER는 읽기와 추론을 분리해 이 결합을 끊는 데 초점을 둡니다.
02
PARSER는 문서를 여러 청크로 나누고 각 청크에 하나의 경량 하위 에이전트를 고정 배치해 전체 문서를 동시에 읽습니다. 리드 에이전트는 매 라운드마다 같은 질의를 모든 하위 에이전트에 브로드캐스트하고, 돌아온 증거를 집계한 뒤 지금까지의 결과에 맞춰 더 깊은 후속 질의를 만듭니다. 따라서 넓은 범위의 병렬 검색과 여러 단계의 집중 추론이 하나의 반복 과정으로 연결됩니다.
03
학습 부담은 리드 에이전트에 집중됩니다. 리드 에이전트만 강화학습으로 질의 생성과 증거 집계 행동을 최적화하고, 각 청크를 읽는 하위 에이전트는 별도 학습 없이 고정된 상용 모델을 사용합니다. 이 분리로 전체 시스템에서 학습해야 하는 영역이 작아지고, 문서 읽기 능력과 추론 제어를 서로 다른 구성 요소에 배치할 수 있습니다.
04
성능 평가는 7K에서 896K 토큰까지의 문맥을 사용하는 다중 추론 질의응답에서 진행됐습니다. 4B PARSER는 가장 강한 순차 메모리 기준선보다 평균 5.7포인트 높았고 896K 토큰에서는 12.0포인트 앞섰으며, 9B 구성은 DeepSeek-V4-Pro보다 6.3포인트 높은 점수를 기록했습니다. 증거 위치와 순서, 거리의 변화를 가한 실험에서도 순차 방식보다 성능 변동이 작았고 추론 지연 시간은 최대 11배 감소했습니다.

용어 해설

장문맥 LLM(Long-Context LLM)
수만에서 수십만 토큰에 이르는 긴 입력을 처리하는 대규모 언어 모델입니다. 긴 문서에서 필요한 증거를 찾아 여러 단계로 추론해야 하므로 문맥 길이, 증거 위치, 추론 지연 시간이 성능에 직접 영향을 줍니다.
순차 메모리 에이전트(Sequential Memory Agent)
긴 문서를 청크 단위로 차례로 읽으면서 지금까지의 정보를 압축된 메모리 상태로 유지하는 에이전트입니다. 문서 이동과 추론이 묶여 증거 위치에 민감하고 문서가 길어질수록 처리 시간이 선형적으로 증가합니다.
분산 수집 방식(Scatter-Gather)
하나의 리드 에이전트가 동일한 질의를 여러 하위 에이전트에 동시에 보내고, 각 응답을 모아 다음 질의를 만드는 처리 방식입니다. PARSER에서는 병렬 증거 수집과 반복적 심층 추론을 결합하는 핵심 실행 구조로 쓰입니다.
다중 추론 질의응답(Multi-hop QA)
문서 안의 여러 위치에 흩어진 증거를 연결해야 답을 찾을 수 있는 질의응답 과제입니다. PARSER의 성능 평가는 7K부터 896K 토큰까지의 문맥에서 이 과제를 사용해 진행됐습니다.
강화학습(Reinforcement Learning)
에이전트의 행동 결과에 따른 보상을 바탕으로 더 나은 의사결정 정책을 학습하는 방법입니다. PARSER에서는 여러 차례의 질의와 증거 수집을 조정하는 리드 에이전트만 강화학습으로 최적화하고 하위 에이전트는 고정합니다.

기술

  • PARSER
  • reinforcement learning
  • DeepSeek-V4-Pro

활용 사례

  • 긴 문서 기반 다중 추론 질의응답
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 11.수집 2026. 09. 11.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.