본문으로 건너뛰기

OpenAI·Anthropic·Gemini·Kimi 라이브 API 비교 벤치마크: 동일 작업에서 최대 10.6배 비용 차이

실제 API로 10개 작업을 1,000회 실행한 결과 모델별 청구 방식과 보이지 않는 내부 추론 토큰 때문에 총비용이 최대 10.6배까지 벌어졌다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

라이브 API로 동일한 10개 현실적 제품 과제를 각 제공자의 비용 최적화 티어에서 1,000회 실행한 벤치마크에서 총비용 차이가 10.6배로 집계되었고, 그 주요 원인은 출력에 드러나지 않는 내부 추론 토큰이 출력 요율로 청구되는 사례와 에이전트 실패 시 과도한 토큰 소모였다. 한 사례에서는 한 단어 응답을 위해 모델이 197토큰의 보이지 않는 추론을 소모했고, 외부 연구인 CostBench와 TerminalWorld의 결과도 실패 시 토큰 소모 증가를 지지하는 통계적 근거를 제공했다. 벤치마크의 방법론과 원시 데이터는 공개되어 있어 실무자가 직접 재현 가능하고, 이 결과는 단순 요율 비교로는 실제 운영비용을 예측할 수 없음을 시사하며 비용 투명성과 모델 동작에 대한 계측의 필요성을 강조한다.

실용적 조언

  • 실제 운영에 앞서 대표적 워크로드를 대상으로 라이브 API에서 토큰 사용량과 비용을 직접 측정해 제공자 간 총비용을 비교해야 한다.
  • 에이전트 설계 시 내부 추론 단계의 길이와 재시도 전략을 제한하거나 비용 제약을 명시적으로 도입해 실패 상황에서의 과도한 토큰 소모를 억제해야 한다.
  • RAG나 다중회차 대화처럼 외부 문서 검색과 긴 컨텍스트를 요구하는 작업에서는 검색 횟수, 청크 길이, 반환 문서 수를 줄여 토큰 소비를 통제할 수 있는 실험을 병행해야 한다.

섹션별 상세

01
벤치마크는 동일한 10개 현실적 제품 과제를 각 제공자의 라이브 비용 최적화 티어로 1,000번씩 실행해 비용을 비교했고, 이 실험에서 총비용 스프레드가 10.6배로 집계되었다. 실험 입력은 분류·RAG 기반 QA·다중회차 대화·에이전트형 실행 작업 등으로 구성되었고 각 작업의 프롬프트와 전체 원시 결과는 공개 저장소에 올려 재현 가능하게 유지되었다. 비용 차이의 핵심 원인은 일부 모델이 출력으로 드러나지 않는 내부 추론 토큰을 출력 토큰과 같은 요율로 청구한 점이며, 이로 인해 짧은 응답에서도 수백 토큰이 소모되는 사례가 관찰되었다. 결과는 제공자별 요금표 상 차이가 2배 내외임에도 실사용 비용은 훨씬 더 크게 벌어질 수 있음을 의미한다.
02
실험에서 가장 뚜렷한 사례는 한 모델이 한 단어 분류 답변을 생성하면서 보이지 않는 추론 과정에서 197토큰을 소모한 케이스로, 입력→모델 내부 추론→단일 단어 출력의 처리 흐름에서 내부 추론 단계가 비용을 지배했다. 이 현상은 모델이 계획·추론·정당화 같은 내부 단계를 길게 수행하되 최종 텍스트 출력은 짧게 끝나는 작업에서 특히 비용 비효율을 초래한다. 벤치마크는 각 작업별로 이런 내부 토큰 소모를 계측 가능한 형태로 수집해 비교했고 특정 작업 유형에서 어떤 제공자가 상대적으로 비싼지 수치로 보여주었다. 따라서 비용 최적화는 단순히 모델별 요금표를 비교하는 것 이상으로 내부 동작과 실패 모드의 토큰 사용을 이해해야 한다는 결론이 도출된다.
03
에이전트와 실패 시 추가 토큰 소모의 연관성도 검토되었으며, 외부 연구인 CostBench(ACL 2026)와 TerminalWorld의 보고와 함께 에이전트 실패가 불필요한 토큰 소비를 유발하는 경향이 확인되었다. 게시물에서는 TerminalWorld가 보고한 실패 시 과도한 토큰 소모와의 상관관계(r = -0.62)를 인용해 실패가 성공보다 토큰을 더 많이 소비한다는 통계적 근거를 제시했고, 이 관찰은 에이전트가 비용 최적화를 고려하지 못하는 설계적 맹점을 반영한다. 이러한 경향은 에이전트 설계에서 계획의 길이, 재시도 정책, 내부 디버깅/디버깅 출력을 어떻게 관리하느냐에 따라 운영비용이 크게 달라질 수 있음을 의미한다.
04
재현성과 투명성을 확보하기 위해 벤치마크의 전체 방법론, 원시 결과, 10개 과제의 프롬프트가 GitHub에 공개되어 있고 결과 시각화로 제공된 차트는 작업별·제공자별 비용 분포를 보여준다. 실험은 라이브 API에 동일한 프롬프트를 보내고 각 응답의 토큰 청구량과 비용을 집계하는 방식으로 진행되었으며, 결과는 제공자 문서의 요율과 실제 청구가 어떻게 달라질 수 있는지를 실증적으로 보여준다. 따라서 이 벤치마크는 비용을 예측하려는 실무자들이 공개 요율만으로 결정을 내릴 때 겪게 될 리스크를 계량화한 근거를 제공한다.

이미지 분석

10개 기능을 각 공급자별로 1,000회 실행했을 때 총비용을 막대그래프로 비교한 차트로, 공급자 간 총비용 격차가 시각적으로 뚜렷하게 드러난다.
Chart

이 차트는 동일한 작업 세트를 기준으로 OpenAI, Anthropic, Kimi, Gemini 등 네 공급자의 총비용을 직접 비교해 주며 막대 위의 수치로 각 공급자의 총비용을 표시했다. 시각화는 공개 요율 대비 실제 청구에서 비용 격차가 크게 벌어질 수 있음을 강조하며, 벤치마크는 전체 스위트에 대한 총USD 비용을 계산해 Gemini가 가장 높은 비용을 기록했음을 보여준다. 이 결과는 단일 작업 대비 내역이 아니라 복합 작업 묶음에서의 총소모를 통해 비용 차이를 증명한다.

10개 기능을 각 공급자별로 1,000회 실행했을 때 총비용을 막대그래프로 비교한 차트로, 공급자 간 총비용 격차가 시각적으로 뚜렷하게 드러난다.

작업별로 공급자별 1,000회 실행 시 비용 분포를 로그 스케일 점 플롯으로 나타낸 그래프이며, 작업 유형에 따라 비용 차이가 어떻게 달라지는지 보여준다.
Chart

로그 스케일의 점 플롯은 각 작업(예: 티켓 분류, 영수증 추출, 장문 요약 등)에 대해 OpenAI·Anthropic·Gemini·Kimi의 비용을 개별 점으로 표시해 작업별 비용 스펙트럼과 공급자 간 상대적 위치를 드러냈다. 이 시각화는 특히 몇몇 작업에서 일부 공급자가 다른 공급자보다 한두 단계 로그 단위로 더 비싸다는 점을 명확히 하고, 짧은 출력에도 내부 추론으로 인해 비용이 커질 수 있는 작업 유형을 식별하는 데 유용하다. 플롯은 또한 로그 축을 사용해 큰 비용 차이를 과소평가하지 않도록 설계되었음을 보여준다.

작업별로 공급자별 1,000회 실행 시 비용 분포를 로그 스케일 점 플롯으로 나타낸 그래프이며, 작업 유형에 따라 비용 차이가 어떻게 달라지는지 보여준다.

용어 해설

검색 증강 생성(RAG)
검색 증강 생성(RAG)은 외부 문서나 인덱스에서 관련 컨텍스트를 검색해 모델 입력으로 주입한 뒤, 모델이 그 컨텍스트를 바탕으로 답변을 생성하는 방식이다. 검색 단계에서 쿼리를 임베딩해 벡터 DB를 조회하고 관련 문서 청크를 반환하며, 반환된 청크가 모델의 프롬프트로 결합되어 응답이 생성된다. 비용과 응답 품질 측면에서 검색 횟수, 문서 길이, 모델이 처리하는 토큰 수가 중요한 영향을 미친다.
에이전트(자율 작업 수행자)(Agent)
에이전트는 도구 호출, 계획 수립, 반복적 환경 상호작용을 통해 복합 작업을 수행하는 프레임워크로서 내부적으로 여러 단계의 계획·추론·도구 사용을 순차적으로 실행한다. 입력으로 작업 목표를 받고 내부 계획 생성과 각 단계의 실행을 거쳐 외부 API 호출이나 추가 질의를 수행한 뒤 최종 출력을 반환한다. 에이전트 설계는 단계별 토큰 소비와 실패 시 재시도 로직이 비용에 큰 영향을 준다.
토큰(청구 단위)(Tokens)
토큰은 모델 입력과 출력을 쪼갠 단위로서 추론 비용이 토큰 수에 비례해 청구되는 경우가 많다. 프롬프트 길이, 모델 내부의 중간 추론(visible 또는 invisible reasoning), 출력 길이가 모두 토큰 소비를 결정하므로 동일한 사용자 답변이라도 내부 추론 단계가 많으면 비용이 크게 증가한다. 각 제공자는 입력·출력·추론 토큰에 대해 서로 다른 요금 체계를 적용하므로 비용 예측을 위해 정확한 토큰 청구 규칙을 이해해야 한다.

언급된 도구

useweckr benchmark중립링크

라이브 API로 여러 공급자의 비용·토큰 사용을 비교하는 벤치마크와 결과 공개

CostBench (ACL 2026)중립

모델의 비용 관련 의사결정과 계획 선택의 효율성을 평가한 학술적 근거

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 23.수집 2026. 07. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.