본문으로 건너뛰기

한 에이전트 작업의 실제 비용 비교 약 100K 입력 토큰과 5K 출력 토큰, 약 10스텝 기준

10스텝 에이전트 루프에서 입력 토큰이 전체 비용의 75~90%를 차지하며 캐싱과 컨텍스트 절감이 비용 절감의 핵심 수단으로 모델 간 최대 40배 차이가 관찰되었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

에이전트 루프에서 비용은 출력 토큰이 아니라 매 스텝 재전송되는 누적 입력 토큰이 주된 원인으로 10스텝 예시에서 입력이 전체 비용의 약 75에서 90퍼센트를 차지했다. 컨텍스트 캐싱은 시스템 프롬프트와 고정 도구 정의 같은 불변 부분을 캐시로 처리해 읽기만 발생시키면 비용을 크게 낮출 수 있으나 도구 출력이 누적되면 캐시 효율이 떨어지고 쓰기 수수료가 추가된다. 동일 작업에서 모델별 원시 가격 차이는 매우 커서 약 40배 스프레드가 관찰되었지만 작성자는 전송하는 컨텍스트를 줄이는 것이 모델 변경보다 더 큰 비용 절감 수단이라는 점을 근거로 제시했다. 공개 요금을 직접 확인해 산출했으며 최신 제한적 프리뷰 모델은 비교에서 제외되어 배포 가능한 모델에 한정한 결과임이 명시됐다.

실용적 조언

  • 매 스텝 재전송되는 컨텍스트를 줄이는 것이 비용 최적화의 가장 직접적인 수단이다. 시스템 프롬프트와 불변 도구 정의만 캐시에서 읽도록 구성하고 가변 툴 결과는 요약하거나 외부 스토리지로 이동시켜 다음 스텝에 필요한 최소 정보만 포함시키는 설계가 권장된다. 이러한 접근은 캐시 효율을 높이고 불필요한 입력 토큰 전송을 줄여 요금 청구 항목을 낮추는 직접적인 효과를 낳는다.
  • 툴 호출 결과가 빈번히 누적되는 워크로드에서는 캐시보다 툴 결과의 구조적 축소가 더 실효적일 수 있다. 예를 들어 툴 결과를 원시 텍스트로 붙이는 대신 핵심 메타데이터만 전송하거나 요약을 생성해 컨텍스트 꼬리를 억제하는 방식이 비용과 응답 속도 측면에서 유리하다. 또한 캐시를 도입할 때는 쓰기 수수료와 읽기 비율을 산정해 실제 절감 효과를 시뮬레이션해야 한다.

섹션별 상세

01
에이전트 실행 비용은 출력 토큰이 아니라 매 스텝 재전송되는 누적 입력 토큰이 거의 대부분을 차지하며 동일 작업의 10스텝 루프에서 입력이 전체 비용의 약 75에서 90퍼센트를 점유한 것으로 보고됐다. 작동 방식은 각 스텝에서 성장하는 컨텍스트 전체를 모델에 다시 보내는 방식이며 이 때문에 출력은 작아도 입력이 쌓이면 비용이 빠르게 증가한다. 원문 작성자는 여러 공급자의 공개 요금을 직접 확인해 이 비중을 추정했고 이 수치는 캐싱 적용 유무에 따라 달라질 수 있다고 명시했다.
02
컨텍스트 캐싱은 고정된 컨텍스트 접두부를 재전송하지 않도록 하여 입력 토큰 비용을 줄이는 메커니즘이며 시스템 프롬프트와 도구 정의 같은 불변 부분이 캐시의 주된 절감 대상으로 확인됐다. 캐시가 작동하면 읽기 비용만 발생해 매 스텝의 재전송 비용이 크게 감소하지만 캐시 대상이 자주 바뀌면 캐시 효율이 떨어진다. 원문에서는 캐시의 절감 효과가 접두부 비중에 의존한다는 점과 캐시 쓰기 수수료가 절감액을 깎아먹을 수 있음을 명시적으로 언급했다.
03
에이전트가 호출한 도구의 결과가 각 스텝에서 누적되는 경우에는 캐시의 효과가 제한되며 이 경우 누적된 툴 출력은 매 스텝 전체 비용이 적용되고 캐시에 쓰려면 추가 쓰기 비용이 발생한다. 작동 흐름은 툴 호출로 결과가 생성되면 그 결과가 컨텍스트 꼬리로 붙고 다음 스텝에서 그대로 다시 전송되는 구조이며 이 꼬리가 길어질수록 캐시는 절감에 크게 기여하지 못한다. 따라서 툴 출력의 가변성 여부가 실제 절감량을 결정하는 실무적 판단 기준으로 제시됐다.
04
여러 모델을 동일한 작업에 적용했을 때 비용 분포의 원시 차이가 크게 나타났으며 원문에서 대략적인 스프레드가 40배 수준으로 제시됐다. 차트의 예시 모델들 가운데 DeepSeek V4 Flash가 가장 저렴한 쪽에 위치했고 GPT-5.5가 가장 높은 비용을 기록해 같은 작업에서도 모델 선택에 따른 비용 차가 크다는 근거가 제시됐다. 다만 원문에서는 비용을 줄이는 더 큰 지렛대는 모델 변경보다도 전송하는 컨텍스트의 크기를 줄이는 것이라고 명확히 지적했다.
여러 상용 모델을 동일 에이전트 작업으로 비교한 가로 막대형 로그 스케일 비용 차트이다.
Chart차트는 동일 작업에서 캐싱 미적용과 캐싱 최적 사례의 두 조건을 나란히 비교해 모델별 비용 분포를 보여준다. 시각적으로 DeepSeek V4 Flash가 가장 낮은 비용대에 위치하고 GPT-5.5가 가장 높은 비용대를 차지해 최대 약 40배의 스프레드가 존재함이 표시됐다. 이 이미지는 논의의 핵심 근거로 사용된 공개 요금 기반 수치와 캐싱의 절감폭을 직관적으로 전달한다.
동일한 차트의 미리보기 버전으로 모델별 캐싱 유무에 따른 비용 비교를 포함한다.
Chart미리보기 이미지는 본문 차트와 동일한 데이터를 담아 가격 비교와 캐싱 효과를 중복 확인할 수 있게 한다. 이미지의 로그 축과 막대 레이블은 작은 비용 차이까지도 상대적으로 읽을 수 있도록 구성되어 있어 토론에서 제시된 수치적 주장의 근거 자료로 활용 가능하다. 두 이미지 모두 원문에서 제시한 수치적 주장에 대한 시각적 근거 역할을 수행한다.
05
실무적 관점에서는 전송할 컨텍스트를 줄이고 고정 접두부만 캐시하는 방식이 비용 대 성능 트레이드오프에서 더 큰 효과를 발휘한다고 제시됐다. 작동 방식으로는 불변하는 시스템 프롬프트와 도구 정의를 캐시 처리하고 가변 툴 결과는 요약하거나 외부 저장소로 오프로드하는 전략이 포함된다. 원문 작성자는 이러한 전략이 모델 간 가격 차이를 좁히기보다는 전체 비용 구조를 근본적으로 낮추는 방향임을 근거로 들었다.
06
데이터 출처와 적용 범위에 대한 언급으로 작성자는 각 공급자의 공식 요금을 오늘 기준으로 확인해 사용했으며 배포 가능한 모델만을 포함했다고 밝혔다. 특히 새로 출시된 제한적 프리뷰 모델은 제외되어 실무에서 즉시 배포 가능한 모델에 한정한 비교 결과가 제시됐다. 이로 인해 제시된 수치가 시점과 모델 가용성에 종속적이라는 한계가 명시됐다.

용어 해설

토큰(Token)
모델 입력과 출력을 구성하는 최소 단위 문자 단위 또는 서브워드 단위의 단위이며 토큰 수에 따라 과금과 처리 시간이 결정된다. 에이전트 루프에서 매 스텝에 재전송되는 입력 토큰이 누적되면 비용이 급격히 증가한다. 이 글에서는 입력 토큰의 누적이 전체 비용을 좌우하는 핵심 변수로 다뤄졌다.
컨텍스트 윈도우(Context Window)
한 번의 추론에서 모델이 참조할 수 있는 최대 토큰 범위를 의미하며 길이가 클수록 더 많은 이전 대화와 도구 결과를 포함할 수 있다. 에이전트는 매 스텝에서 누적 컨텍스트를 재전송하므로 컨텍스트 윈도우와 비용이 직접적으로 연결된다. 본문에서는 약 10스텝 루프와 큰 입력 토큰 집합을 전제로 비용 분포를 산정했다.
컨텍스트 캐싱(Context Caching)
매 스텝 동일하게 유지되는 컨텍스트 부분을 캐시에서 읽어 모델 요청으로 재전송하지 않도록 하는 기법으로 읽기 캐시 비율에 따라 비용 절감 효과가 달라진다. 시스템 프롬프트나 도구 정의와 같이 고정된 접두부를 캐싱하면 입력 토큰 비용을 크게 낮출 수 있다. 본문에서는 캐시 읽기 비율의 최적 사례와 쓰기 수수료가 절감 효과에 미치는 영향을 분리해 논의했다.
툴 출력(Tool Output)
에이전트가 외부 툴을 호출해 얻는 결과물로, 각 스텝에서 누적되면 컨텍스트의 가변 꼬리 부분을 형성해 캐싱 효과를 감소시킨다. 툴 출력은 매 스텝 전체 가격이 적용되며 캐시에 저장하려면 쓰기 수수료가 추가로 발생한다. 본문에서는 툴 출력의 누적이 캐싱으로 해결되지 않을 때 비용 절감이 제한된다고 판정됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 29.수집 2026. 06. 30.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.