프런티어 벤치마크
프런티어 벤치마크는 최첨단 언어 모델들의 능력을 비용·성능 관점에서 비교하기 위해 설계된 평가 프레임워크로서, 시도당 비용을 로그 스케일로 두고 다양한 노력(노력 수준)에 따른 성공률(점수)을 측정하여 효율성과 성능 간 트레이드오프를 가시화한다. 본문과 제공된 차트에서는 이 벤치가 Opus 5, Fable 5, 이전 Opus 계열 및 GPT 5.6 Sol을 비용 대비 점수로 비교하는 지표로 사용됐다. 벤치 결과는 모델 출시 후의 주장과 독립적 평가를 교차검증하는 근거로 기능한다.