TL;DR
기업이 AI 투자 효율을 이해하려면 토큰당 비용 같은 단일 지표보다 업무 단위의 성과와 비용을 함께 평가해야 한다는 관점에서 달러당 유용한 AI 성과라는 네 가지 지표가 제안되었다. 이 지표는 무엇이 '완료'인지 정의하고 실제로 성공적으로 완료된 작업 수에 전체 비용을 나누어 작업당 비용을 산정하며, 결과의 신뢰성은 사람의 검토 필요성 여부로 정량화된다. 또한 규모가 커질수록 비용 대비 완료된 작업이 더 빠르게 증가하면 경제성이 개선되고, 이를 위해 학습·추론 컴퓨트와 하드웨어·알고리즘 최적화가 핵심 역할을 한다. OpenAI는 GPT‑5.6 제품군 사례를 들어 일부 워크플로에서 출력 토큰과 예상 API 비용을 줄인 수치(출력 토큰 54% 감소, DeepSWE에서 비용 36.2% 절감, 성능 72.7%)를 제시하며 모델·인프라·플랫폼 통합이 달러당 성과를 향상시킨다고 보고하고 있다.
빠른 이해
새로운 점
달러당 유용한 AI 성과라는 실무 중심의 비용·신뢰성·규모 지표로 모델 선택과 인프라 개선을 연결한 점.
핵심 메커니즘
사용자 요청과 워크플로 컨텍스트를 입력으로 받아 모델이 긴 문맥과 도구 호출을 통해 추론을 수행하고, 출력의 품질을 '완료' 기준으로 평가하여 성공 작업 수와 전체 비용을 기준으로 달러당 유용성을 계산한다.
핵심 수치
- 출력 토큰 사용량 감소: 54% 적음- Artificial Analysis Coding Agent Index에서 GPT‑5.6 Sol이 다른 선도 모델보다 출력 토큰을 54% 적게 사용하면서 최고 성능 달성
- DeepSWE v1.1 성능 및 비용: 72.7% 성능, API 비용 36.2% 절감- GPT‑5.6 Sol이 DeepSWE v1.1에서 72.7%를 기록하며 Claude Fable 5의 69.9%를 앞섬
섹션별 상세
AI 가치 평가의 문제 제기와 핵심 질문
일의 완료를 어떻게 정의하고 측정할 것인가
작업 하나를 완료하는 데 드는 실제 비용의 계산 방식과 모델 선택의 경제성
- GPT‑5.6 Sol은 다른 선도 모델보다 출력 토큰을 54% 적게 사용하면서도 새로운 최고 성능을 기록했다. — 본문의 모델 제품군 설명과 Artificial Analysis Coding Agent Index 결과가 나오는 단락
- DeepSWE v1.1 평가에서 GPT‑5.6 Sol은 예상 API 비용을 36.2% 낮추면서 72.7% 점수를 기록하여 Claude Fable 5의 69.9%를 능가했다. — DeepSWE v1.1 결과가 제시된 문단
결과의 신뢰성(의존성)과 운영 경계 설정
규모의 경제와 컴퓨트의 중앙적 역할
플랫폼 통합과 개선의 파급 효과
종합적 성과 지표와 반복적 개선의 목표
용어 해설
- 성공 작업당 비용(Cost per Successful Task)
- — 성공 기준을 충족한 작업 하나를 완료하는 데 소요된 전체 비용을 말한다. 입력 처리비용, 토큰·컴퓨팅 소비, 사람의 검토·재작업 비용을 모두 합산한 뒤 성공적으로 완료된 작업 수로 나누어 계산한다. 이 지표는 토큰당 가격이 낮더라도 실제 업무 단위 비용이 높을 수 있음을 가려내는 데 중요하다.
- 달러당 유용한 AI 성과(Useful Work per Dollar)
- — 투입된 비용 한 단위(달러)로 얻을 수 있는 실제로 활용 가능한 업무 결과의 양을 나타내는 종합 지표이다. 결과의 유용성은 업무 완료 정의, 신뢰성 수준, 인적 검토 필요성 등을 반영하여 측정하며 비용 대비 가치 판단의 기준이 된다. 기업의 의사결정과 모델 선택을 비용-가치 관점으로 정렬하는 데 활용된다.
- 추론 컴퓨트(Inference Compute)
- — 실제 서비스 환경에서 모델이 입력 요청에 답변을 생성하는 데 소모되는 계산 자원과 관련된 개념이다. 단위 시간당 처리량, 지연, 전력·클라우드 비용, 오프로드·가속화 기법의 영향을 받으며 결과당 비용에 직접적인 영향을 준다. 추론 효율 개선은 달러당 유용한 성과를 높이는 핵심 요소이다.
- 의존성 지표(Dependability Metric)
- — AI 출력이 실무에서 그대로 사용 가능한지 판단하는 기준으로서 '바로 사용 가능', '수정 필요', '에스컬레이션 필요'와 같은 분류를 포함한다. 이 지표는 모델 정확도뿐 아니라 출처·일관성·예외 처리 능력과 거버넌스 요구를 반영하여 측정된다. 의존성이 높아지면 사람의 검토 비용이 줄어들어 결과당 총비용이 감소한다.
기술
- ChatGPT
- ChatGPT Work
- Codex
- API
- GPT‑5.6
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


