본문으로 건너뛰기

약 10K 프롬프트에서 프롬프트 압축 기법을 비교한 결과

약 10K 프롬프트 비교에서 LLM 요약이 품질은 최고였으나 비용과 지연으로 절감 효과가 제한되었고 50% 단순 축소는 오라클 리콜을 62%로 낮추었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 약 10K 프롬프트를 대상으로 여러 프롬프트 압축 기법을 같은 입력 집합에서 비교해 각 접근의 응답 품질·토큰 절감·지연·비용 영향을 평가했다. 단순 잘라내기는 50% 축소에서 오라클 리콜이 62%로 하락해 품질 손실이 명확했고 LLM 요약은 품질이 가장 높았으나 추가 호출로 인한 지연과 비용이 전체 절감 효과를 약화시켰다. 실험 결과는 질의 인식 기반 보존 정책이 모델 크기보다 더 큰 영향을 미친다고 나타났으며 상세 수치와 작업별 표는 공개된 벤치마크 링크에서 확인할 수 있다.

실용적 조언

  • 긴 프롬프트를 다룰 때는 LLM 요약이 품질을 가장 잘 보존하므로 배치 처리나 품질 우선 워크로드에서 우선 고려할 수 있다.
  • 단순히 입력을 잘라내는 방식은 50% 수준의 축소에서 오라클 리콜이 크게 하락하므로 응답 완전성이 중요한 경우 지양해야 한다.
  • 질의 인식 기반의 보존 정책을 우선 적용하면 핵심 정보를 유지하면서 토큰을 줄이는 효율을 얻을 수 있으므로 쿼리 분석 단계를 도입하는 것이 권장된다.

섹션별 상세

01
작성자는 약 10K개의 프롬프트를 여러 작업 유형에 걸쳐 수집해 동일한 입력 집합에서 여러 압축 방법을 비교했다. 비교 대상에는 truncation, sliding window, LLM summarization, top-K retrieval, MMR, ModernBERT 분류기, 그리고 작성자 자체의 소형 학습 정책이 포함되었다. 각 방법은 입력을 어떻게 줄이는지(예: 단순 잘라내기, 청크 기반, 요약, 검색 기반 선택, 분류 기반 보존 결정)에 따라 처리 과정을 달리했고 그 결과 응답 품질, 토큰 절감, 지연, 비용 등을 기준으로 평가되었다.
02
단순 잘라내기(truncation)는 일반적으로 생각보다 성능 저하가 컸다. 작성자가 보고한 핵심 수치는 50% 토큰 축소 시 오라클 리콜이 62%로 떨어진 점으로, 이는 잘려나간 정보로 인해 답변에서 누락이 많이 발생함을 뜻한다. 토큰 절감은 확보되지만 응답의 완전성이 저해되어 실제 응용에서는 품질 손실을 고려해야 한다.
03
LLM을 이용한 요약은 품질 면에서 가장 우수한 결과를 냈으나 비용과 지연이라는 실무적 제약이 수익을 잠식했다. 요약을 위해 추가적인 LLM 호출이 필요해 호출 비용과 응답 지연이 증가하므로 총 토큰·비용 절감 이득이 줄어들었다. 따라서 이 접근은 매우 긴 프롬프트를 배치로 처리하거나 품질 우선 시나리오에서만 경제성이 확보된다는 실무적 결론이 도출되었다.
04
질의 인식 능력(query-awareness)이 모델 크기보다 더 결정적인 요인으로 관찰되었다. 사용자가 실제로 묻는 바를 분석해 보존할 토큰과 제거할 토큰을 선택하면 핵심 정보를 외과적으로 유지할 수 있으며 이는 단순 축소보다 품질 저하를 줄이는 데 효과적이었다. 이 관찰은 프롬프트 압축 전략 설계에서 질의-조건화 보존 정책이 우선 고려되어야 함을 시사한다.
05
작성자는 전체 수치와 작업별 벤치마크 표를 공개 링크에 게시하여 세부 재현 및 비교가 가능하도록 했다. 링크에서는 각 기법의 작업별 성능과 지연·비용 영향 등을 확인할 수 있으며 이 데이터는 후속 실험이나 실무 적용 시 근거 자료로 사용될 수 있다. 공개된 벤치마크는 압축 기법 선택 시 트레이드오프를 정량적으로 판단하는 근거가 된다.

용어 해설

Top-K 검색(Top-K Retrieval)
쿼리 임베딩과 문서 임베딩 간 유사도를 계산해 상위 K개 문서를 반환하는 방법이다. 입력 쿼리를 임베딩 공간으로 변환한 뒤 유사도 기반 검색을 수행하고 그 결과를 컨텍스트로 주입하여 모델이 응답을 생성하도록 한다. 이 글에서는 문맥 축소 시 핵심 청크를 찾는 기본 비교 기법으로 사용되어 응답 품질과 토큰 절감 간의 절충을 평가하는 데 중요하게 작용했다.
Maximal Marginal Relevance(MMR)
검색 결과의 다양성과 관련성을 동시에 고려해 재순위하는 기법으로, 중복 정보를 줄이면서 쿼리 관련 문서들만 우선 선택한다. 각 후보 문서의 쿼리 유사도와 기존 선택군과의 중복도를 조합해 점수를 계산한 뒤 순위를 매긴다. 본 벤치마크에서는 유사도 기반 재순위로 핵심 정보를 보존해 압축 효율을 개선하는 방법으로 비교되었다.
슬라이딩 윈도우(Sliding Window)
긴 문서를 고정 크기 청크로 순차 분할하여 각 청크를 별도로 처리하거나 검색에 사용하는 방식이다. 입력을 겹치게 슬라이딩하면 문맥 경계에서의 정보 손실을 줄일 수 있으나 처리 비용과 중복 토큰이 늘어난다. 이 실험에서는 청크화 기반 접근의 토큰 절감 대 품질 손실을 비교하는 대조군으로 활용되었다.
LLM 요약(LLM Summarization)
대형 언어모델을 호출해 긴 입력을 압축된 요약 텍스트로 변환하는 방법으로, 입력에서 핵심 정보를 추출해 짧은 프롬프트로 대체한다. 요약 과정은 추가적인 모델 호출과 지연, 그리고 호출 비용을 발생시키지만 요약된 텍스트는 원본보다 토큰을 적게 사용하면서 품질을 보존하는 경향이 있다. 본 벤치마크에서는 품질 측면에서 가장 높은 성능을 보였으나 비용·지연 트레이드오프가 관건으로 드러났다.
오라클 리콜(Oracle Recall)
압축된 입력으로 생성된 답변이 잘려나간 원본 정보로 인해 놓친 항목이 있는지를 판단하는 지표로, 원본과 비교해 필요한 정보가 남아 있는 비율을 측정한다. 보통 압축 방식이 정보 보존에 미치는 영향을 정량화하기 위해 사용되며 본 벤치마크에서는 50% 축소 시 62%를 기록한 수치가 핵심 근거로 활용되었다. 이 지표는 토큰 절감과 응답 완전성 간의 균형을 평가하는 데 중요한 역할을 한다.

언급된 도구

ModernBERT중립

프롬프트 청크의 중요도를 분류해 보존/삭제 결정을 돕는 분류기

MMR중립

검색 결과의 다양성과 관련성을 고려해 재순위를 통해 핵심 청크를 선택하는 방법

Top-K Retrieval중립

쿼리와 문서 임베딩 유사도 기반으로 상위 K개 컨텍스트를 선택하는 검색 기법

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 04.수집 2026. 07. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.