본문으로 건너뛰기

프리필 청크 분할 실험

겹침을 둔 4k 청크 프리필이 256k 입력에서 검색 성능을 유지하며 속도를 3배 높였습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

긴 프롬프트를 여러 청크로 나눠 각각의 캐시를 만든 뒤 결합하는 prefill 방식이 Ling3-tiny의 non-KDA layers에서 시험됐습니다. 청크 사이에 overlap을 넣자 256k 토큰 입력을 4k 단위로 처리해도 간단한 needle-in-a-haystack retrieval과 분할 정보의 종합이 유지됐습니다. 작성자는 이 설정에서 prefill 속도가 3배 올라 약 1.3k tps에 도달했으며, 5090에서 Qwen3.8-27b를 실행할 때와 비슷한 속도라고 밝혔습니다. 다만 다른 작업에서 발생할 trade-off는 아직 확인되지 않았습니다.

합의점 vs 논쟁점

논쟁점

  • 청크 분할과 overlap이 검색 작업에서는 효과를 냈지만, 작성자도 아직 다른 trade-off가 있을 가능성을 남겨 두었습니다. 현재 결과는 간단한 retrieval task와 Ling3-tiny의 non-KDA layers에 한정된 관찰입니다. 따라서 긴 입력 전반에서 정보 보존과 생성 품질이 동일하게 유지되는지는 추가 검증이 필요합니다.

실용적 조언

  • 긴 입력에 이 방식을 적용할 때는 각 부분을 독립적으로 처리한 뒤 생성에 필요한 캐시를 결합하는 흐름을 구성하고, 청크 사이에 overlap을 두는 방식이 사용됐습니다. 작성자의 시험에서는 256k 토큰을 4k 토큰 단위로 나눴으며 overlap이 needle-in-a-haystack retrieval 유지에 기여했습니다. 다만 현재 확인된 대상이 간단한 검색 작업이므로 다른 작업에서는 별도로 품질을 측정해야 합니다.

섹션별 상세

01
긴 프롬프트 전체에 일반적인 prefill을 적용하는 대신 입력을 A와 B 같은 여러 부분으로 나눠 각각의 캐시를 독립적으로 만든 뒤 이어 붙이는 접근입니다. 결합된 캐시를 일반적인 decode 단계에 넣어 기존 생성 흐름을 유지하는 구조이며, 작성자는 처음에는 이 방식이 실패할 것으로 예상했습니다. 그러나 Ling3-tiny의 non-KDA layers에서 청크 사이에 overlap을 넣자 needle-in-a-haystack 검색과 분할된 정보의 종합이 유지됐습니다.
02
작성자는 256k 토큰 입력을 4k 단위 청크로 나눠 간단한 검색 작업을 시험했고, 지금까지 성능 저하가 관찰되지 않았다고 밝혔습니다. 이 설정에서 prefill 속도는 3배 향상되어 256k 토큰 기준 약 1.3k tps에 도달했습니다. 이는 작성자의 5090에서 Qwen3.8-27b를 실행할 때와 거의 같은 prefill 속도지만, 어떤 작업에서도 같은 결과가 유지되는지는 아직 확인되지 않았습니다.

용어 해설

프리필(prefill)
모델이 입력 프롬프트 전체를 먼저 읽고 다음 토큰 생성에 필요한 중간 상태를 계산하는 단계입니다. 이 글에서는 긴 입력을 한 번에 처리하지 않고 여러 청크로 나눠 계산해 처리량을 높이는 대상으로 사용됩니다.
KV 캐시(cache)
Transformer가 입력을 처리하며 만든 Key와 Value 상태를 저장해 이후 토큰 생성에서 반복 계산을 줄이는 메모리 구조입니다. 글의 방식은 분할된 각 부분에서 만든 캐시를 이어 붙여 decode 단계에 전달합니다.
디코드(decode)
프리필로 입력 상태를 만든 뒤 모델이 토큰을 한 개씩 생성하는 단계입니다. 이 실험에서는 각 청크의 처리 결과를 결합한 뒤 일반적인 디코드 과정으로 넘겨 분할 입력이 유지되는지 확인했습니다.
청크 오버랩(overlap)
긴 입력을 여러 조각으로 나눌 때 인접한 조각의 일부 토큰을 겹치게 포함하는 방식입니다. 글에서는 청크 사이에 겹치는 내용을 넣었을 때 분할된 정보 사이의 검색과 종합이 유지됐다고 관찰했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.