TL;DR
작성자는 Artificial Analysis의 지능 대비 비용 도표가 로그 비용축 때문에 실제 지출 차이를 직관적으로 읽기 어렵다고 보고 선형축 기반의 자체 산점도를 만들었습니다. DeepSeek V4 Flash 0731과 GLM-5.3은 OpenRouter 가격을, Qwen3.8-27B는 47,166 output tok/task, 55 tok/s, 350W, 지역별 전기요금과 15%의 추가 비용을 바탕으로 계산했습니다. 로컬 실행 비용에서는 게임·업무용으로도 쓰는 장비의 가격을 제외했지만, 128GB Strix Halo나 약 16,000달러 장비처럼 AI 전용성이 높아지면 이 기준이 약해진다고 정리했습니다.
주요 논점
작성자는 Artificial Analysis의 로그 비용축이 모델 간 실제 지출 차이를 왜곡해 보이게 한다고 보고, 선형 비용축과 자체 실행 비용 추정을 적용한 대체 도표를 만들었습니다.
합의점 vs 논쟁점
논쟁점
- 비용축을 로그에서 선형으로 바꾸는 것이 더 현실적인 비교인지에 대해서는 사용 목적에 따라 판단이 달라질 수 있습니다. 로그축은 가격 범위가 넓은 모델들을 한 화면에 배치하는 데 유리하지만, 선형축은 저비용 구간의 차이를 더 직접적으로 읽게 합니다. 어느 축이 적절한지는 API 비용의 배수 비교를 중시하는지 실제 월 지출을 중시하는지에 달려 있습니다.
- 자체 호스팅 비용에서 하드웨어 가격을 제외하는 기준은 장비의 사용 목적에 따라 달라집니다. 게임과 업무에도 쓰는 RTX 3090 PC라면 전기요금 중심 계산이 가능하지만, AI를 위해 128GB Strix Halo나 약 16,000달러 규모 장비를 추가하는 경우에는 초기 구매비를 빼기 어렵습니다. 따라서 클라우드 API와 로컬 실행의 우열을 단일 점으로 고정하기보다 하드웨어 감가상각과 프라이버시 가치를 별도로 계산해야 합니다.
실용적 조언
- 모델 비용을 실제 사용자 관점에서 비교하려면 로그축과 선형축을 함께 확인하는 편이 좋습니다. 로그축에서는 가격 배수와 넓은 범위의 분포를 읽고, 선형축에서는 작업당 절대 비용과 저가 모델 간 차이를 읽을 수 있습니다. 특히 작업당 비용이 모두 매우 낮은 구간은 별도 확대 그래프를 두어야 작은 차이를 과대해석하지 않을 수 있습니다.
- 로컬 실행 비용은 출력 토큰 수, 생성 속도, 소비전력, 전기요금, prefill과 도구 대기 시간을 분리해 계산해야 합니다. 이 글의 Qwen3.8-27B 계산처럼 47,166 output tok/task와 55 tok/s, 350W를 입력값으로 삼으면 대략적인 작업당 전력비를 얻을 수 있지만, 하드웨어 가격을 0으로 둘 수 있는지는 장비가 AI 외 용도에도 필요한지에 따라 달라집니다. AI 전용 장비를 구매하는 경우에는 전기요금만으로 API와의 손익분기점을 판단하지 않는 것이 안전합니다.
섹션별 상세
이미지 분석

첫 번째 차트는 x축을 0.00달러부터 2.40달러까지 선형으로 두고, y축에 Artificial Analysis Intelligence Index를 배치했습니다. Claude Opus 5가 약 2.30달러와 63점으로 가장 오른쪽 위에 있으며, GPT-5.6 Sol은 약 1.25달러와 61점, Grok 4.6은 약 0.85달러와 61점에 놓였습니다. DeepSeek V4 Flash 0731, Qwen3.8-27B 등 저비용 모델은 왼쪽 아래에 밀집해 있어 작성자가 추가한 모델과 비용 계산의 위치를 확인할 수 있습니다.
모델별 Artificial Analysis 지능 지수와 작업당 비용을 선형 비용축으로 배치한 산점도입니다.

두 번째 차트는 x축을 로그 스케일로 두고 0.05달러부터 10달러 이상까지 모델 비용을 배치했습니다. 초록색 영역은 지능 지수 58점 이상이면서 상대적으로 낮은 비용인 매력적인 사분면을 나타내며, GLM-5.3, Grok 4.6, Kimi K3가 그 경계에 가깝게 놓여 있습니다. Claude Opus 5는 약 2.30달러와 63점, GPT-5.6 Sol은 약 0.90달러와 61점으로 표시되어 첫 번째 차트와 로그축의 시각적 차이를 비교하게 합니다.
Artificial Analysis의 지능 지수와 작업당 비용을 로그 비용축 및 매력적인 사분면과 함께 표시한 원본 산점도입니다.
용어 해설
- 로그arithmic Scale(Logarithmic Scale)
- — 로그arithmic Scale은 축의 값이 일정한 차이가 아니라 일정한 배수로 증가하도록 배치하는 방식입니다. 모델 비용처럼 값의 범위가 넓을 때 점들을 한 화면에 담기 쉽지만, 작성자는 사람의 실제 지출 감각과 차이가 생긴다고 판단해 선형축으로 바꿨습니다.
- 선형 스케일(Linear Scale)
- — 선형 스케일은 축의 동일한 간격이 동일한 절대값 차이를 뜻하는 좌표 방식입니다. 이 글에서는 비용축을 선형으로 바꿔 모델 간 실제 지출 차이를 직관적으로 비교하려 했습니다. 다만 매우 저렴한 모델이 몰려 있는 구간은 여전히 세밀한 비교가 어렵습니다.
- OpenRouter
- — OpenRouter는 여러 모델을 제3자 제공업체의 API 가격으로 이용할 수 있는 서비스입니다. 글에서는 DeepSeek V4 Flash 0731의 현재 비용과 GLM-5.3의 예상 비용을 계산할 때 가격 기준으로 사용했습니다.
- 최대 사고 모드(max thinking)
- — max thinking은 모델이 허용된 최대 수준의 추론 과정을 사용하도록 설정한 상태를 가리킵니다. 두 도표의 모델 점수는 모두 이 조건에서 Artificial Analysis가 산출한 지능 지수를 사용해 비교 조건을 맞췄습니다.
언급된 도구
DeepSeek V4 Flash 0731의 현재 제3자 제공업체 가격과 GLM-5.3의 예상 가격을 비용 계산에 사용했습니다.
작성자가 DeepSeek V4 Flash 0731과 GLM-5.3을 현재 이용할 수 있는지 설명하는 맥락에서 언급했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.