TL;DR
이미지에 실린 FrontierCode 벤치마크는 Mean cost per task(USD, 로그 스케일)에 따른 Score(%)를 비교해 세 모델의 비용 대비 정확도를 보여주고 있으며 다이아몬드 서브셋은 가장 어려운 50문항으로 구성되어 고난이도 성능을 측정했다. 그래프에서는 Claude Fable 5가 비용을 높일수록 점진적·가파르게 성능이 올라 최고 약 31%에 도달했고 Claude Opus 4.8은 중간에서 높은 비용 구간 사이에 약 13%로 정점을 보이며 일부 구간에서 포화 현상이 관찰됐다. GPT-5.5는 전체 비용 범위에서 약 5–6% 선을 유지해 다른 두 모델에 비해 비용 대비 정확도가 낮았고 이는 비용을 증가시켜 성능을 얻는 전략의 유효성과 한계를 동시에 시사했다.
섹션별 상세


용어 해설
- Diamond subset
- — 벤치마크 데이터에서 난이도가 높은 상위 50문항으로 구성된 하위집합으로, 전체 150문항 가운데 가장 어려운 문제들만 골라 모델의 고난도 처리 능력을 평가하는 데 사용된다. 이 서브셋은 평균 성능보다 오답률이 높게 나타나기 때문에 모델 간 차이를 더 명확하게 드러낸다. 이미지의 그래프에서는 이 서브셋을 기준으로 한 점수(%)를 표시하고 있다.
- Mean cost per task
- — 각 모델이 해당 작업을 수행하는 데 소요된 평균 비용을 미국 달러 단위로 계산한 지표로, 이미지에서는 로그 스케일로 표시되어 비용 증가에 따른 성능 변화를 한눈에 볼 수 있게 구성되어 있다. 비용은 모델 호출 빈도와 토큰 사용량 등 실제 실행 비용 요소를 평균화한 값으로 해석할 수 있다. 로그 스케일 사용으로 낮은 비용대와 높은 비용대의 변화를 동시에 비교할 수 있다.
- Score (accuracy)
- — 테스트된 작업들에서 모델이 정답으로 판정된 비율을 백분율로 환산한 지표로, 본 그래프에서는 각 비용 수준에서의 성능을 퍼센트로 표기해 비용 대비 정확도를 비교한다. 값은 전체 또는 다이아몬드 서브셋과 같은 하위집합에 대해 산출될 수 있으며, 이미지 하단에 다이아몬드 서브셋이 언급되어 있다. 이 점수는 모델 간 상대적 성능 차이를 시각화하는 데 핵심적이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.