본문으로 건너뛰기

LangChain 1.0 에이전트의 토큰 비용 절감을 위한 Axor 미들웨어 공개

장기 실행되는 LangChain 에이전트의 토큰 누수를 방지하기 위해 메시지 압축 및 도구 최적화를 수행하는 Axor 미들웨어가 공개됐다.

실용적 조언

  • 비용 절감이 최우선이라면 OpenAI aggressive 프로필을, 성능 유지가 최우선이라면 Anthropic cautious 프로필을 선택하라.
  • 프롬프트 캐싱을 함께 사용할 경우 반드시 Axor 미들웨어를 캐싱 미들웨어보다 앞에 배치하라.

섹션별 상세

01
장기 실행 에이전트에서 발생하는 토큰 블리딩 문제를 해결하기 위해 모델 호출 시마다 메시지를 최적화한다. 에이전트가 과거에 수행한 도구 출력이나 중간 추론 과정을 압축하고 최근 결과물만 원문으로 유지하여 컨텍스트 효율을 높인다. 이를 통해 불필요한 데이터가 매 호출마다 반복 전송되는 것을 방지하고 모델의 집중도를 개선한다.
python
from langchain.agents import create_agent
from axor_langchain import AxorMiddleware

axor = AxorMiddleware(optimization_profile="cautious")
agent = create_agent(
    "anthropic:claude-sonnet-4-6",
    tools=tools,
    middleware=[axor],
)

LangChain 에이전트에 Axor 미들웨어를 드롭인 방식으로 적용하는 예시 코드

02
OpenAI와 Anthropic 모델을 대상으로 공격적(aggressive) 및 신중한(cautious) 두 가지 최적화 프로필을 검증했다. OpenAI 모델에 공격적 프로필을 적용했을 때 비용 절감률은 77.0%에 달했으며 판정 점수 0.91로 원본과 거의 동등한 성능을 보였다. Anthropic 모델의 경우 신중한 프로필에서 30.0%의 절감률과 0.96의 높은 성능 유지력을 기록했다.
03
Anthropic의 프롬프트 캐싱 미들웨어와 함께 사용할 때의 상호 운용성을 고려하여 설계됐다. 미들웨어 적용 순서에서 Axor를 먼저 배치하여 메시지 압축을 수행한 뒤 캐시 마커를 찍어야 최적의 캐싱 효율을 얻을 수 있다. 또한 읽기 전용 도구에 대해 LangGraph 상태의 thread_id 기반으로 도구 결과 캐싱 기능을 제공하여 결정론적 동작을 지원한다.

용어 해설

미들웨어(Middleware)
애플리케이션과 운영 체제 또는 라이브러리 사이에서 데이터 흐름을 제어하고 가공하는 소프트웨어 계층이다. 이 글에서는 LangChain 에이전트의 모델 호출 전후에 개입하여 토큰을 압축하거나 도구 사용을 최적화하는 역할을 수행한다.
토큰 블리딩(Token Bleeding)
에이전트가 장시간 실행되면서 과거의 도구 출력물이나 중간 추론 과정이 컨텍스트에 계속 누적되어 불필요한 비용을 발생시키는 현상이다. 이를 방치하면 모델의 컨텍스트 윈도우를 초과하거나 추론 성능이 저하되는 원인이 된다.
프롬프트 캐싱(Prompt Caching)
자주 반복되는 프롬프트 접두사를 모델 제공자 측에 저장하여 재사용함으로써 비용과 지연 시간을 줄이는 기술이다. Axor 미들웨어는 압축을 먼저 수행한 후 캐시 마커를 찍는 방식으로 이 기술과 결합하여 효율을 극대화한다.

언급된 도구

axor-langchain추천

LangChain 에이전트용 토큰 최적화 미들웨어

LangGraph중립

에이전트 상태 관리 및 스레드 기반 데이터 유지

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 04.수집 2026. 05. 05.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.