본문으로 건너뛰기
OpenAI조회 1

AI 시대의 성과 지표

OpenAI는 달러당 유용한 AI 성과라는 네 가지 지표로 AI 가치를 정량화하고 GPT‑5.6 사례로 작업당 비용과 신뢰성의 경제적 차이를 입증했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기업이 AI 투자 효율을 이해하려면 토큰당 비용 같은 단일 지표보다 업무 단위의 성과와 비용을 함께 평가해야 한다는 관점에서 달러당 유용한 AI 성과라는 네 가지 지표가 제안되었다. 이 지표는 무엇이 '완료'인지 정의하고 실제로 성공적으로 완료된 작업 수에 전체 비용을 나누어 작업당 비용을 산정하며, 결과의 신뢰성은 사람의 검토 필요성 여부로 정량화된다. 또한 규모가 커질수록 비용 대비 완료된 작업이 더 빠르게 증가하면 경제성이 개선되고, 이를 위해 학습·추론 컴퓨트와 하드웨어·알고리즘 최적화가 핵심 역할을 한다. OpenAI는 GPT‑5.6 제품군 사례를 들어 일부 워크플로에서 출력 토큰과 예상 API 비용을 줄인 수치(출력 토큰 54% 감소, DeepSWE에서 비용 36.2% 절감, 성능 72.7%)를 제시하며 모델·인프라·플랫폼 통합이 달러당 성과를 향상시킨다고 보고하고 있다.

빠른 이해

새로운 점

달러당 유용한 AI 성과라는 실무 중심의 비용·신뢰성·규모 지표로 모델 선택과 인프라 개선을 연결한 점.

핵심 메커니즘

사용자 요청과 워크플로 컨텍스트를 입력으로 받아 모델이 긴 문맥과 도구 호출을 통해 추론을 수행하고, 출력의 품질을 '완료' 기준으로 평가하여 성공 작업 수와 전체 비용을 기준으로 달러당 유용성을 계산한다.

핵심 수치

  • 출력 토큰 사용량 감소: 54% 적음- Artificial Analysis Coding Agent Index에서 GPT‑5.6 Sol이 다른 선도 모델보다 출력 토큰을 54% 적게 사용하면서 최고 성능 달성
  • DeepSWE v1.1 성능 및 비용: 72.7% 성능, API 비용 36.2% 절감- GPT‑5.6 Sol이 DeepSWE v1.1에서 72.7%를 기록하며 Claude Fable 5의 69.9%를 앞섬

섹션별 상세

AI 가치 평가의 문제 제기와 핵심 질문

경영진은 AI 투자 대비 실제 경제적 가치를 판단하려고 하며 전통적인 도입 지표만으로는 충분하지 않다고 인식하고 있다. 구매한 시트 수나 활성 사용자 수 같은 지표로는 AI가 실제로 얼마나 많은 업무를 완료했는지를 가늠할 수 없기 때문에 결과 단위의 비용과 성과를 함께 측정해야 한다. 이 때문에 달러당 유용한 AI 성과라는 개념이 제안되었고, 이 개념은 가치 있는 업무의 양, 작업당 비용, 결과 신뢰성, 사용량 확대 시 경제성이라는 네 가지 질문으로 구체화된다.

일의 완료를 어떻게 정의하고 측정할 것인가

유용한 성과를 측정하려면 먼저 각 워크플로에서 무엇을 '완료'로 볼 것인지 명확히 정의해야 한다. 고객 지원에서는 문의 해결, 엔지니어링에서는 테스트를 통과한 코드, 법무에서는 정확히 검토된 계약서처럼 각 팀의 실제 업무 성과 기준을 시스템 레벨에서 측정 가능한 결과로 전환해야 한다. 토큰 사용량 자체는 가치가 아니라 결과를 만들어내는 수단이므로, 실제로 사람이 활용할 수 있는 출력이 생성되었는지를 중심으로 측정해야 한다.

작업 하나를 완료하는 데 드는 실제 비용의 계산 방식과 모델 선택의 경제성

작업당 비용은 해당 작업을 완료하는 데 들어간 전체 비용을 합산한 뒤 요구 품질을 충족한 성공 작업 수로 나누어 계산한다. 여기에는 모델의 토큰·컴퓨트 비용뿐 아니라 사람의 검토·재시도·재작업 비용까지 포함되어야 하며, 따라서 토큰당 가격이 낮더라도 결과당 비용이 높을 수 있다. 원문은 GPT‑5.6 제품군(Sol/Terra/Luna)을 예로 들어 업무의 복잡도에 따라 Sol이 재시도를 줄여 결과당 비용을 낮출 수 있고 Luna는 대량 처리에 적합하다고 제시하며, 해당 주장 근거로 출력 토큰 54% 감소와 DeepSWE v1.1에서의 비용·성능 수치가 포함되어 있다.
근거
  • GPT‑5.6 Sol은 다른 선도 모델보다 출력 토큰을 54% 적게 사용하면서도 새로운 최고 성능을 기록했다. 본문의 모델 제품군 설명과 Artificial Analysis Coding Agent Index 결과가 나오는 단락
  • DeepSWE v1.1 평가에서 GPT‑5.6 Sol은 예상 API 비용을 36.2% 낮추면서 72.7% 점수를 기록하여 Claude Fable 5의 69.9%를 능가했다. DeepSWE v1.1 결과가 제시된 문단

결과의 신뢰성(의존성)과 운영 경계 설정

의존성은 단순한 모델 정확도를 넘어 결과를 그대로 활용할 수 있는지 여부를 판단하는 것으로서 경제적 가치와 직결된다. 조직은 산출물이 '바로 사용 가능', '수정 필요', '에스컬레이션 필요' 가운데 어디에 속하는지를 추적하여 사람의 개입 비용을 정량화해야 하며, 이를 위해 데이터 접근 범위, 시스템 변경 허용 범위, 검토·승인 시점을 명확히 규정해야 한다. 보안·프라이버시·통제 체계가 선행되어야 AI가 초안을 넘어서 업무를 실제로 완료하는 단계로 이동할 수 있다.

규모의 경제와 컴퓨트의 중앙적 역할

규모가 커질수록 동일 워크플로의 성공 작업 수가 총비용보다 빠르게 증가하면 달러당 가치가 개선된다는 관점에서 컴퓨트는 핵심 입력 요소로 작동한다. 학습 컴퓨트는 미래의 모델 능력을 키우고 추론 컴퓨트는 현재의 업무를 수행하며, 하드웨어·알고리즘·유지비용 최적화가 복합적으로 비용 대비 성과를 향상시킨다. 원문은 더 나은 인프라와 제품 설계가 순환적으로 연구·모델·제품·채택을 증폭시켜 장기적으로 더 많은 유용한 작업을 달성할 수 있게 만든다고 기술하고 있다.

플랫폼 통합과 개선의 파급 효과

공유된 인텔리전스 플랫폼을 통해 한 계층의 개선이 다른 제품과 고객에 곧바로 전파되며 이는 조직 전체의 비용-효율성에 영향을 준다. ChatGPT, ChatGPT Work, Codex, API 같은 제품군은 동일한 기반 위에서 작동하므로 추론 효율 또는 모델 능력의 향상이 곧바로 실무 워크플로의 유용성 증가와 비용 절감으로 연결된다. 따라서 플랫폼 차원의 거버넌스·보안·워크스페이스 관리가 성과 지표를 안정적으로 개선하는 데 필수적이다.

종합적 성과 지표와 반복적 개선의 목표

네 가지 측정항목은 합쳐져서 달러당 유용한 AI 성과가 향상되는지를 보여주며 각각은 무엇을 생산하는지, 그 결과를 얻는 데 드는 비용, 결과의 신뢰성, 그리고 규모의 경제를 평가한다. 목표는 더 능력 있는 모델과 더 효율적인 추론, 더 낮은 결과당 비용을 통해 시간이 지남에 따라 동일 자원으로 더 많은 의미 있는 작업을 수행할 수 있게 하는 것이다. 이러한 지표를 바탕으로 모델·인프라·운영을 반복적으로 개선하면 조직이 AI를 실제 업무의 일부로 통합하는 과정이 가속화된다.

용어 해설

성공 작업당 비용(Cost per Successful Task)
성공 기준을 충족한 작업 하나를 완료하는 데 소요된 전체 비용을 말한다. 입력 처리비용, 토큰·컴퓨팅 소비, 사람의 검토·재작업 비용을 모두 합산한 뒤 성공적으로 완료된 작업 수로 나누어 계산한다. 이 지표는 토큰당 가격이 낮더라도 실제 업무 단위 비용이 높을 수 있음을 가려내는 데 중요하다.
달러당 유용한 AI 성과(Useful Work per Dollar)
투입된 비용 한 단위(달러)로 얻을 수 있는 실제로 활용 가능한 업무 결과의 양을 나타내는 종합 지표이다. 결과의 유용성은 업무 완료 정의, 신뢰성 수준, 인적 검토 필요성 등을 반영하여 측정하며 비용 대비 가치 판단의 기준이 된다. 기업의 의사결정과 모델 선택을 비용-가치 관점으로 정렬하는 데 활용된다.
추론 컴퓨트(Inference Compute)
실제 서비스 환경에서 모델이 입력 요청에 답변을 생성하는 데 소모되는 계산 자원과 관련된 개념이다. 단위 시간당 처리량, 지연, 전력·클라우드 비용, 오프로드·가속화 기법의 영향을 받으며 결과당 비용에 직접적인 영향을 준다. 추론 효율 개선은 달러당 유용한 성과를 높이는 핵심 요소이다.
의존성 지표(Dependability Metric)
AI 출력이 실무에서 그대로 사용 가능한지 판단하는 기준으로서 '바로 사용 가능', '수정 필요', '에스컬레이션 필요'와 같은 분류를 포함한다. 이 지표는 모델 정확도뿐 아니라 출처·일관성·예외 처리 능력과 거버넌스 요구를 반영하여 측정된다. 의존성이 높아지면 사람의 검토 비용이 줄어들어 결과당 총비용이 감소한다.

기술

  • ChatGPT
  • ChatGPT Work
  • Codex
  • API
  • GPT‑5.6

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 07. 28.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.