섹션별 상세
단순한 토큰 카운팅 방식은 추론 모델의 등장과 복잡한 과금 체계로 인해 한계에 직면했다. o1이나 Claude와 같은 모델은 응답에 나타나지 않는 내부 추론 토큰을 소비하며, 이를 무시할 경우 실제 비용을 30-40% 과소평가하게 된다. 따라서 가시적인 출력물뿐만 아니라 모델의 내부 동작 비용을 포함하는 정교한 추적 시스템이 필요하다.

근거
- OpenAI o1-preview는 출력 토큰 가격이 입력의 4배이며, 가시적인 토큰만 계산할 경우 비용을 30-40% 과소평가하게 된다. — 1. Thinking tokens 섹션
제공업체마다 상이한 캐시 및 컨텍스트 정책이 비용 산정의 불확실성을 높인다. Anthropic은 캐시 쓰기에 추가 비용을 부과하지만 OpenAI는 이를 무료로 제공하며, 특정 컨텍스트 길이를 넘어서면 단가가 자동으로 두 배가 되기도 한다. 이러한 정보는 API 응답에 명시되지 않으므로 게이트웨이 레벨에서 실시간으로 로직을 적용해야 정확한 비용 계산이 가능하다.
근거
- 컨텍스트 길이가 128K 토큰을 초과할 경우 토큰당 비용이 $0.075에서 $0.15로 두 배 증가할 수 있다. — 3. Context thresholds 섹션
동일한 모델이라도 호스팅 제공업체에 따라 가격이 다르며 식별자 체계도 제각각이다. Llama 3 모델을 Together AI에서 쓰는지 Fireworks에서 쓰는지에 따라 단가가 다르며, Azure나 Bedrock은 고유의 리전 접두사나 배포 이름을 사용한다. Portkey는 이러한 다양한 식별자를 표준 모델 ID로 매핑하고 제공자별 가격표를 동적으로 적용하는 정규화 레이어를 구현했다.
typescript
type Tokens = {
reqUnits: number;
resUnits: number;
cacheWriteInputUnits?: number;
cacheReadInputUnits?: number;
reqAudioUnits?: number;
resAudioUnits?: number;
additionalUnits?: {
[key: string]: number;
// web search, code execution...
};
};다양한 LLM 제공업체의 사용량 데이터를 단일한 구조로 표준화하기 위한 인터페이스 정의


이미지, 오디오, 웹 검색 등 토큰 기반이 아닌 새로운 과금 차원이 계속해서 추가되고 있다. DALL-E 3는 해상도 기준, 비디오 생성은 초당 비용, 구글 검색 증강은 검색 횟수당 비용을 청구하는 등 과금 단위가 파편화되어 있다. 이를 해결하기 위해 Portkey는 additionalUnits라는 가변 맵 구조를 도입하여 스키마 변경 없이 새로운 과금 차원을 수용할 수 있도록 설계했다.
3,500개가 넘는 모델의 가격 정보를 수동으로 관리하는 것은 불가능에 가깝다. Portkey는 Claude Agent SDK를 기반으로 한 가격 책정 에이전트를 구축하여 각 제공업체의 API와 문서를 스크래핑하고 자동으로 PR을 생성하도록 했다. 특히 제공업체별 특이사항을 코드가 아닌 마크다운 형식의 '스킬 파일'로 관리하여 에이전트의 유연성을 극대화했다.
용어 해설
- 추론 토큰(Thinking Tokens)
- — o1이나 Claude와 같은 추론 모델이 최종 응답을 생성하기 전 내부적으로 사고하는 과정에서 소비하는 토큰이다. 사용자에게는 보이지 않지만 실제 비용 청구에는 포함되므로 정확한 비용 산정을 위해 반드시 고려해야 하는 요소이다.
- 캐시 비대칭성(Cache Asymmetry)
- — LLM 제공업체마다 프롬프트 캐싱에 대한 과금 방식이 서로 다른 현상을 의미한다. Anthropic은 캐시 쓰기에 추가 비용을 부과하는 반면 OpenAI는 쓰기 비용을 받지 않는 등 제공자별 차이가 있어 통합 비용 계산 시 복잡성을 유발한다.
- 컨텍스트 임계값(Context Threshold)
- — 특정 토큰 수(예: 128K)를 초과할 때 토큰당 단가가 급격히 상승하는 지점이다. API 응답에는 어떤 티어가 적용되었는지 명시되지 않는 경우가 많아 실시간 비용 추적을 어렵게 만드는 주요 원인이다.
- 비용 귀속(Cost Attribution)
- — 발생한 LLM 사용 비용을 특정 팀, 사용자 또는 프로젝트 단위로 정확하게 할당하는 프로세스이다. 대규모 조직에서 AI 예산을 관리하고 최적화하기 위해 필수적인 FinOps 역량이다.
기술
- Portkey
- Claude Agent SDK
- OpenAI
- Anthropic
- AWS Bedrock
- Azure
활용 사례
- 기업 내 팀별 AI 사용 예산 할당 및 제한
- LLM API 재판매 서비스의 정확한 마진 계산
- 멀티 모델 환경에서의 실시간 비용 모니터링
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 15.수집 2026. 04. 15.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.