본문으로 건너뛰기

에이전트 작업 실제 비용 v2 — 토큰 사용량을 반영한 비교 (~100K 입력 + 5K 출력, 측정된 발화량, 약 10단계)

작성자는 모델별 출력 발화량(AA의 토큰 카운트)과 공급자 가격을 반영해 에이전트 작업 비용을 재계산했고 캐시 적중률이 발화량 차이보다 비용에 미치는 영향이 훨씬 크다고 나타났다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 동일한 에이전트 작업 형상(약 100K 입력과 5K 출력, 약 10단계)에서 모델별 출력 발화량을 AA(Artificial Analysis)의 토큰 카운트로 보정해 공급자 가격과 곱하는 방식으로 작업당 비용을 재계산했고 이 과정에서 AA 인덱스 버전 차이와 데이터 믹스가 결과 해석에 영향을 줄 수 있음을 명시했다. 보정 결과 일부 모델은 다른 모델보다 훨씬 많은 출력 토큰을 소모하는 것으로 나타났고 출력 단가가 높은 구간에서는 발화량 차이가 비용에 실질적 영향을 미쳤지만 전반적으로 캐시가 적용되는 최선의 경우가 발화량 차이보다 비용을 더 크게 낮추는 것으로 관찰됐다. 게시물은 방법과 원자료 링크를 댓글에 제시했고 작성자는 Claude로 집계를 수행한 뒤 공급자 페이지를 교차 확인해 일부 행을 수작업으로 재검증해 결과의 투명성을 보완했다.

실용적 조언

  • 에이전트 비용을 추산할 때는 모델별 출력 토큰 합계를 측정해 가격에 곱하는 방식으로 발화량을 반영해야 한다는 점이 도출됐다.
  • 반복되는 prefix나 상태를 캐싱하면 출력 발화량이 커도 전체 비용을 크게 낮출 수 있으므로 캐시 적중률을 우선적으로 최적화할 필요가 있다.
  • 공개 벤치마크 수치(예: AA의 eval index)를 사용할 때는 인덱스 버전과 평가 믹스가 실제 워크로드와 일치하는지 확인해 교차 검증을 수행해야 한다.

섹션별 상세

01
이전 비교에서 발생한 문제는 '토큰 수 테이블로 가격을 매겼음에도 실제 작업 단위의 토큰 소비량이 모델마다 크게 달라 동일한 토큰 수 기준이 채터한 모델에 유리하게 작용했다는 점'이다. 이 게시물은 동일한 작업 형상을 유지하면서 모델별 출력 토큰 총량을 측정값으로 반영해 비용을 재계산했다. 작성자는 이 보정이 발화량 차이에 따른 비용 편향을 줄이기 위한 목적이며 실제 토큰 카운트는 Artificial Analysis(AA)의 eval index에서 가져온 값임을 명시했다.
02
방법론은 출력 부분을 각 모델의 측정된 발화량으로 스케일링하고 공급자별 현재 리스트 가격을 곱해 작업 단가를 산출하는 것이다. 입력 기준은 이미지 제목과 동일하게 약 100K 입력과 5K 출력, 약 10단계의 작업을 가정했고 출력 토큰은 AA가 공개한 모델별 출력 토큰 총합을 프록시로 사용했다. 다만 AA가 인덱스 이관 중이라 일부 모델은 버전 차이로 조정하지 않았고 AA의 평가 믹스가 작성자의 실제 에이전트 트레이스와 다르므로 근거는 근사치로 취급해야 한다.
03
주요 관찰 결과는 몇 가지로 요약된다; DeepSeek V4 Flash가 동일한 집합에서 Claude Opus보다 약 두 배의 출력 토큰을 소모했고 출력 가격이 높은 모델 구간에서 발화량 차이는 비용에 실질적 영향을 미친다. 예시로 출력 단가가 0.28달러/백만 토큰 수준이면 발화량 차이는 작업당 수년 미만의 센트 단위 영향으로 축소될 수 있음을 언급했다. GPT-5.5의 경우 AA의 구버전 카운트를 사용해 해당 행을 조정하지 않아 전체 스프레드가 크게 변하지 않았다고 보고했다.
04
캐싱 효과가 비용 민감도에서 훨씬 더 큰 요인으로 관찰되었으며 작성자는 캐시 적중률 40/70/90%의 민감도 데이터를 댓글에 제시했다. 기술적으로 프롬프트 캐싱은 반복되는 prefix나 상태를 저장해 이후 호출에서 토큰 계산을 회피하므로 출력 발화량이 커도 캐시가 있으면 비용이 급감한다. 작성자는 수치 산출과 집계 작업을 Claude가 수행했고 본인이 공급자 페이지의 가격을 확인해 두 개 행을 수작업으로 재검증했다고 공개해 계산 투명성을 보완했다.

이미지 분석

여러 LLM에 대해 동일 에이전트 작업의 단가를 캐시 없음과 컨텍스트 캐시(최선 경우)로 비교한 로그 스케일 가로 막대형 차트이다.
Chart

차트는 모델별로 'no caching'과 'context cached (best case)' 두 조건에서 작업당 비용을 비교하고 있으며 각 막대 위에 달러 단위 표시가 있어 상대적 비용 차이를 시각적으로 보여준다. 축과 제목에서 입력·출력 규모(~100K 입력 + 5K 출력, 약 10단계)와 AA의 발화량 데이터를 사용한 보정이 명시되어 있어 이미지가 본문의 핵심 산출 방법과 결과를 직접적으로 전달한다. 차트에서 하단에 가까운 모델일수록 비용이 높게 나타나며 캐시가 적용될 때 비용이 크게 낮아지는 경향이 시각적으로 확인된다.

여러 LLM에 대해 동일 에이전트 작업의 단가를 캐시 없음과 컨텍스트 캐시(최선 경우)로 비교한 로그 스케일 가로 막대형 차트이다.

첫 번째 이미지와 동일한 내용의 차트 축소판으로 동일한 모델별 비용 비교를 반복 표시하고 있다.
Chart

두 번째 이미지는 첫 번째와 사실상 동일한 차트를 다른 해상도나 프리뷰용 URL로 제공한 것으로 보이며 동일한 수치와 시각적 비교를 복제하고 있다. 이미지에는 각 모델의 no-caching과 cached 케이스의 수치 레이블이 포함되어 있어 본문에서 언급한 '캐시의 영향이 발화량 영향보다 크다'는 주장을 시각적 근거로 뒷받침한다. 본문과 댓글의 방법 링크를 확인하면 이 차트가 어떤 토큰 카운트와 가격표를 사용해 계산되었는지 재현할 수 있다.

첫 번째 이미지와 동일한 내용의 차트 축소판으로 동일한 모델별 비용 비교를 반복 표시하고 있다.

용어 해설

토큰 발화량(Token verbosity)
한 모델이 동일한 작업에서 생성하는 출력 토큰의 총량을 의미한다. 입력과 내부 단계는 동일하더라도 모델의 응답 길이와 반복적 중간 출력이 다르면 전체 비용이 달라지므로 비용 비교에서 발화량을 모델별로 보정해야 한다. 이 글에서는 AA(Artificial Analysis)의 출력 토큰 카운트를 발화량의 근사치로 사용했다.
프롬프트 캐싱(Prompt caching)
동일한 프롬프트나 대화 prefix를 해시 키로 저장하고 이후 요청에서 캐시된 토큰 계산 결과를 재사용하는 방식이다. 입력 반복 구간의 재계산을 회피해 추론 시 토큰 처리량과 비용을 크게 줄일 수 있으며 캐시 적중률에 따라 비용 절감 폭이 크게 달라진다. 이 글에서는 캐시 적중률이 발화량 차이보다 비용에 더 큰 영향을 미친다고 평가했다.
평가 인덱스(Evaluation index)
모델별로 균일한 입력 항목을 돌려 결과 토큰·응답 특성 등을 측정해 정리한 데이터 집합 또는 벤치마크를 의미한다. 이 글에서는 Artificial Analysis(AA)의 eval index에서 제공한 모델별 출력 토큰 합계를 발화량 프록시로 사용했고 인덱스 버전 차이가 결과 해석에 영향을 미쳤다. 인덱스는 실무 작업 트레이스와는 다를 수 있어 주의가 필요하다.

언급된 도구

Artificial Analysis (AA) eval index중립

모델별 출력 토큰 합계와 발화량 프록시 제공

Claude중립

데이터 집계 및 산술 처리 보조

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 08.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.