본문으로 건너뛰기

모델 회귀로 오인된 문제의 실원인은 컨텍스트 블로트였음

도구 카탈로그를 매 턴 모두 주입하는 대신 쿼리별 랭킹으로 관련 도구만 전달하자 입력 토큰이 70~85% 줄고 일부 모델에서는 정확도가 약 8포인트 상승했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 최근 모델 업데이트 후 에이전트가 자주 잘못된 도구를 호출하는 현상을 경험하고 원인을 추적한 결과 컨텍스트 블로트, 즉 매 턴 모든 도구 정의를 포함해 컨텍스트 예산을 낭비하는 설계가 문제였음을 확인했다. 비교 실험은 전체 도구 카탈로그를 매 턴 주입하는 방식과 쿼리별로 도구를 랭킹해 관련 도구만 전달하는 방식을 사용했으며 그 결과 입력 토큰이 모델별로 70~85% 감소했고 대부분의 경우 정확도는 유지되었으며 일부 모델에서는 약 8포인트의 정확도 향상이 관찰되었다. 동시에 한 모델에서는 절감에도 불구하고 정확도가 떨어지는 사례가 있어 이 방법이 모든 설정에서 보편적으로 통용되지는 않음을 보여주었다. 따라서 도구·지시문·검색 결과 등 컨텍스트 요소를 쿼리별로 선별하는 접근은 토큰 비용과 노이즈를 줄이는 실무적 해결책이지만 각 모델과 워크로드에서 재현 가능한 벤치마크로 검증해야 한다.

실용적 조언

  • 매 턴에 포함되는 도구 정의가 토큰 예산을 어떻게 소모하는지 우선 계량하라. 도구 이름과 사용법을 포함한 정의의 토큰 비용을 측정하면 컨텍스트 절감의 예상 이득을 정량적으로 산출할 수 있다.
  • 쿼리별 랭킹을 도입해 관련 도구만 컨텍스트에 주입하는 파이프라인을 구성하라. 입력 텍스트를 특성화한 후 랭커가 상위 N개 도구만 선택하도록 구현하면 토큰 사용량을 크게 줄이면서 잘못된 도구 호출을 줄일 수 있다.
  • 모델별로 효과가 달라지므로 변경을 적용하기 전에 자체 벤치마크를 반드시 실행하라. 작성자가 공유한 ratel-bench 같은 도구를 사용해 토큰 절감과 정확도 변화를 동시에 측정하면 의사결정을 데이터 기반으로 내릴 수 있다.

섹션별 상세

01
작성자는 최근 모델 업데이트로 에이전트의 도구 호출이 더 자주 틀려졌고 이것이 모델 성능 저하로 보였다고 문제를 제기했다. 원인을 파악하기 위해 각 턴마다 사용 가능한 모든 도구 정의를 포함하는 방식과 쿼리별로 도구를 랭킹해 관련 도구만 전달하는 방식을 비교하는 벤치마크를 실행했다. 비교 방식은 입력 텍스트를 기준으로 관련도 순위를 매겨 도구 정의의 부분집합만 컨텍스트에 주입하는 처리 파이프라인을 사용했고 이 실험으로 컨텍스트 구성 방식이 실제 성능에 미치는 영향을 직접 측정했다. 벤치마크 결과는 컨텍스트 설계가 모델 동작에 결정적 역할을 할 수 있음을 실무적으로 제시했다.
02
벤치마크의 핵심 측정은 토큰 사용량과 정확도 변화였고, 전체 도구 카탈로그를 매 턴 전달하는 설정과 도구를 선별해 전달하는 설정의 입력 토큰을 비교했다. 실험에서는 입력 토큰이 모델별로 70%에서 85%까지 감소했고 대다수 경우 정확도는 유지되었으며 일부 경우에는 오히려 향상된 결과가 관찰되었다. 한 사례에서는 전체 토큰을 72% 절감하면서 정확도가 약 8포인트 상승했는데, 보고된 수치는 컨텍스트에서 노이즈가 제거되면 모델의 도구 선택과 응답 품질이 개선될 수 있음을 수치로 뒷받침한다. 이 결과는 토큰 비용 절감뿐 아니라 잘못된 도구 호출 감소라는 실용적 이점까지 함께 제공함을 시사한다.
03
작성자는 그러나 이 접근법이 보편적이지는 않다고 명확히 했다. 동일한 도구 선별 방식이 어떤 모델에서는 큰 이득을 냈지만 다른 모델에서는 정확도가 하락한 사례가 관찰되었기 때문에 모델·설정·작업 유형에 따라 반응이 달라진다고 보고했다. 이 관찰은 컨텍스트 축소가 정보 손실을 유발할 가능성을 내포하기 때문에 도구 랭킹을 적용할 때는 각 모델과 워크로드에서 재현 가능한 벤치마크를 통해 검증해야 한다는 실험적 권고로 이어진다. 따라서 실무 적용 시에는 토큰 절감 효과와 정확도 변화를 병행 측정하는 평가 설계가 필수적이다.
04
작성자는 도구 정의 외에도 지시문, 검색된 문서, 메모리 등 컨텍스트에 주입되는 다른 구성요소에도 동일한 원리가 적용될 가능성을 제기했다. 입력이 많아질수록 모델의 주목 자원이 분산되기 때문에 관련성 기반 필터링이나 랭킹으로 핵심 신호만 유지하면 노이즈가 줄고 의사결정 질이 개선될 여지가 있다. 다음 실험으로 작성자는 도구 외 다른 컨텍스트 요소들에 대해 동일한 계측과 필터링을 적용해 효과를 검증하려고 계획하고 있다고 밝혔다. 이 점은 에이전트 설계에서 컨텍스트 예산을 종합적으로 관리해야 한다는 실무적 통찰을 제공한다.

용어 해설

컨텍스트 윈도우(Context Window)
컨텍스트 윈도우는 모델이 한 번에 참조할 수 있는 토큰의 상한선으로, 입력·도구 정의·지시문·검색 결과 등이 이 한도 내에 포함되어야 한다. 컨텍스트가 한도를 초과하면 초과 분이 잘리거나 비용이 급증하므로 중요한 정보만 선별해 전달하는 것이 핵심이다. 에이전트 설계에서는 컨텍스트 윈도우를 예산으로 보고 필요한 구성요소만 주입하는 방식이 성능과 비용에 직접적인 영향을 준다.
도구 카탈로그(Tool Catalog)
도구 카탈로그는 에이전트가 호출할 수 있는 함수·API·플러그인 정의들의 집합으로, 각 정의는 사용법과 입력·출력 형식을 포함한다. 모든 도구 정의를 매 턴 컨텍스트에 포함하면 토큰 예산을 크게 소모하며 모델이 불필요한 도구 호출을 시도할 위험이 커진다. 따라서 카탈로그를 동적으로 필터링하거나 랭킹해 관련 도구만 주입하는 설계가 비용과 정확도 측면에서 중요하다.
도구 랭킹(Tool Ranking)
도구 랭킹은 주어진 쿼리 또는 대화 맥락에 대해 호출 가능성이나 관련도를 평가해 필요한 도구의 우선순위를 매기는 과정으로, 입력 텍스트를 기반으로 후보 도구를 선별해 컨텍스트에 포함한다. 랭킹을 통해 매 턴 포함되는 도구 정의 수를 줄이면 토큰 사용량이 감소하고 노이즈가 줄어 모델의 올바른 도구 선택 확률이 높아질 수 있다. 이 방법은 검색된 문서·메모리·지시문 등 다른 컨텍스트 요소에도 동일한 원리로 적용된다.
컨텍스트 블로트(Context Bloat)
컨텍스트 블로트는 불필요하거나 관련성이 낮은 정보가 반복적으로 컨텍스트에 축적되어 토큰 예산을 낭비하고 모델의 주목 대상을 흐리는 현상이다. 블로트가 심해지면 모델이 핵심 정보 대신 주변 노이즈에 민감해져 잘못된 도구 호출이나 부정확한 응답이 늘어나는 결과가 나타난다. 따라서 컨텍스트 구성 요소를 정량적으로 측정하고 쿼리별로 선별하는 계측과 제어가 실무에서 중요하다.

언급된 도구

ratel-bench추천링크

에이전트 컨텍스트 구성 방식(전체 도구 전달 vs 쿼리별 도구 랭킹)을 비교하는 벤치마크 하니스

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.