TL;DR
이 차트는 ARC-AGI-3 벤치마크에서 모델별 총 평가 비용(USD, 로그 스케일)과 신규 문제 해결 점수(%)를 비교한 시각 자료로서 비용 축이 넓은 범위를 한 화면에 보여주기 위해 로그 스케일이 사용되었다. 그래프 상에서 Opus 5 (high)는 대략 $20,000 수준의 평가 비용에서 약 30%의 점수를 기록하여 다른 모델보다 높은 신규 문제 해결 능력을 보였고 GPT-5.6 Sol은 중간 수준, Opus 4.8 (high)은 낮은 수준에 분포했다. 이 결과는 동일한 평가 체계에서 비용 투입이 성능 향상으로 직결되지 않을 수 있음을 시사하며 평가 예산과 모델 버전 선택을 함께 고려해야 함을 보여준다.
섹션별 상세
이미지 분석

차트는 각 모델을 점으로 표시하고 연결선으로 비용 대비 점수 추이를 나타내어 비용 범위에서의 성능 변화를 시각적으로 확인하게 한다. 눈금표와 레이블로 $10,000와 $20,000 지점을 표시하여 비용 구간의 상대적 위치를 파악하게 하고, Opus 5의 점이 약 30% 근처에 있어 다른 점들과 명확히 구분된다. 이 이미지는 비용과 성능의 트레이드오프를 논의하거나 평가 예산을 설계할 때 근거 자료로 활용될 수 있다.
가로축에 총 평가 비용(USD, 로그 스케일)과 세로축에 신규 문제 해결 점수(%)를 놓은 산점도 형태의 차트로, Opus 5가 높은 점수로 돋보인다.

프리뷰 이미지는 원본과 동일한 축과 점 배치를 유지하여 Opus 5가 높은 점수대로 군집하고 GPT-5.6 Sol과 Opus 4.8은 상대적으로 낮은 위치에 있음을 반복해 보여준다. 로그 스케일 가로축과 퍼센트 세로축의 조합이 비용 범위가 넓은 데이터를 한 화면에 담아 비용 대비 성능 추이를 직관적으로 판단하게 만든다. 본 이미지는 벤치마크 결과를 근거로 성능과 비용 효율을 비교하는 논의에 직접적인 시각적 근거를 제공한다.
동일한 차트의 프리뷰 버전으로, 평가 비용 대비 신규 문제 해결 점수를 모델별로 비교하여 Opus 5의 우위를 확인하게 한다.
용어 해설
- ARC-AGI-3
- — ARC-AGI-3은 인공지능 모델의 고유한 문제 해결 능력을 평가하는 벤치마크로, 다양한 신규 문제에 대한 정답률을 측정하여 모델 간 비교를 가능하게 한다. 본 이미지 맥락에서는 각 모델이 평가에 소요된 총 비용과 그에 따른 점수를 축으로 하여 성능 차이를 시각화하는 데 사용되었다. 벤치마크 결과는 모델 설계와 비용 투입의 상관관계 판단에 근거 자료로 활용된다.
- Log scale
- — 로그 스케일은 가로축과 같이 값 범위가 넓을 때 지수적 변화를 균등하게 표현하기 위해 사용되는 축 표기법으로, 작은 값과 큰 값을 동시에 시각화할 때 원래 값의 곱셈 관계를 선형적으로 보여준다. 본 차트에서는 평가 비용을 로그 스케일로 표현하여 수천 달러에서 수만 달러 수준까지의 비용 차이를 한 눈에 비교하도록 설계되었다. 로그 스케일 사용은 비용 대비 성능의 기울기와 변곡을 더 명확히 파악하게 한다.
- Evaluation cost
- — 평가 비용은 벤치마크를 수행하는 데 들어간 총 금전적 투입을 의미하며, 모델 호출 비용·인프라 사용료·사람 평가 비용 등이 합산되어 계산된다. 이미지에서는 Total evaluation cost (USD, log scale)로 표기되어 각 모델의 평가에 투입된 달러 액수를 가로축에 배치하였다. 비용은 모델 비교에서 단순 성능 수치와 함께 효율성을 평가하는 핵심 지표로 작동한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
