본문으로 건너뛰기

비용 대비 신규 문제 해결 능력 비교(ARC-AGI-3)

ARC-AGI-3 벤치마크에서 비용이 증가할수록 Opus 5가 약 30%로 가장 높은 신규 문제 해결 점수를 기록했고 GPT-5.6 Sol은 중간 수준이었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 차트는 ARC-AGI-3 벤치마크에서 모델별 총 평가 비용(USD, 로그 스케일)과 신규 문제 해결 점수(%)를 비교한 시각 자료로서 비용 축이 넓은 범위를 한 화면에 보여주기 위해 로그 스케일이 사용되었다. 그래프 상에서 Opus 5 (high)는 대략 $20,000 수준의 평가 비용에서 약 30%의 점수를 기록하여 다른 모델보다 높은 신규 문제 해결 능력을 보였고 GPT-5.6 Sol은 중간 수준, Opus 4.8 (high)은 낮은 수준에 분포했다. 이 결과는 동일한 평가 체계에서 비용 투입이 성능 향상으로 직결되지 않을 수 있음을 시사하며 평가 예산과 모델 버전 선택을 함께 고려해야 함을 보여준다.

섹션별 상세

01
제시된 그래프는 가로축에 총 평가 비용을 로그 스케일로, 세로축에 신규 문제 해결 점수(%)를 두어 모델별 비용 대비 성능을 시각화한 것이다. 입력으로는 각 모델의 평가에 사용된 비용 수치가 투입되고 처리 과정에서 각 모델의 해결률이 점으로 표기되어 연결선으로 추세를 보여준다. 축 레이블과 눈금에 $10,000와 $20,000가 표시되어 있어 비용 범위의 상대적 위치를 확인할 수 있다.
02
Opus 5 (high)는 그래프 상에서 가장 높은 점수를 기록하며 비용이 대략 $20,000 수준일 때 세로축에서 대략 30% 근방에 위치한다는 점이 눈에 띈다. 이 지점은 동일한 축 위의 다른 모델들보다 점수가 월등히 높아 비용을 많이 투입한 평가 환경에서 Opus 5의 신규 문제 해결 능력이 상대적으로 우수함을 가리킨다. 데이터 시각화는 비용 증가와 함께 모델 성능이 비선형적으로 상승할 수 있음을 시사한다.
03
GPT-5.6 Sol은 중간 범위의 성능을 보이며 그래프에서 약간 우상향하는 위치에 있어 비용 증가에 따라 점수가 소폭 개선되는 패턴을 보인다. 이 모델의 점수는 Opus 5보다 낮지만 Opus 4.8보다는 높은 수준에 분포하여 중간 비용대에서의 현실적 성능과 비용 효율성을 동시에 고려해야 함을 보여준다. 시각적 근거는 축에 표시된 비용 눈금과 점들의 상대적 높이로 확인할 수 있다.
04
Opus 4.8 (high)는 가장 낮은 점수대에 모여 있으며 그래프에서 비용 대비 점수 상승이 제한적인 모습을 보인다. 이 위치는 동일한 평가 체계에서 동일 계열 모델의 버전 차이가 성능에 실질적 영향을 미칠 수 있음을 시사하며, 단순 비용 투입만으로는 성능 개선을 보장하지 못할 가능성을 드러낸다. 결과적으로 평가 예산을 책정할 때는 모델 버전과 비용 대비 개선량을 함께 비교하는 접근이 필요함이 확인된다.

이미지 분석

가로축에 총 평가 비용(USD, 로그 스케일)과 세로축에 신규 문제 해결 점수(%)를 놓은 산점도 형태의 차트로, Opus 5가 높은 점수로 돋보인다.
Chart

차트는 각 모델을 점으로 표시하고 연결선으로 비용 대비 점수 추이를 나타내어 비용 범위에서의 성능 변화를 시각적으로 확인하게 한다. 눈금표와 레이블로 $10,000와 $20,000 지점을 표시하여 비용 구간의 상대적 위치를 파악하게 하고, Opus 5의 점이 약 30% 근처에 있어 다른 점들과 명확히 구분된다. 이 이미지는 비용과 성능의 트레이드오프를 논의하거나 평가 예산을 설계할 때 근거 자료로 활용될 수 있다.

가로축에 총 평가 비용(USD, 로그 스케일)과 세로축에 신규 문제 해결 점수(%)를 놓은 산점도 형태의 차트로, Opus 5가 높은 점수로 돋보인다.

동일한 차트의 프리뷰 버전으로, 평가 비용 대비 신규 문제 해결 점수를 모델별로 비교하여 Opus 5의 우위를 확인하게 한다.
Chart

프리뷰 이미지는 원본과 동일한 축과 점 배치를 유지하여 Opus 5가 높은 점수대로 군집하고 GPT-5.6 Sol과 Opus 4.8은 상대적으로 낮은 위치에 있음을 반복해 보여준다. 로그 스케일 가로축과 퍼센트 세로축의 조합이 비용 범위가 넓은 데이터를 한 화면에 담아 비용 대비 성능 추이를 직관적으로 판단하게 만든다. 본 이미지는 벤치마크 결과를 근거로 성능과 비용 효율을 비교하는 논의에 직접적인 시각적 근거를 제공한다.

동일한 차트의 프리뷰 버전으로, 평가 비용 대비 신규 문제 해결 점수를 모델별로 비교하여 Opus 5의 우위를 확인하게 한다.

용어 해설

ARC-AGI-3 벤치마크(ARC-AGI-3)
ARC-AGI-3은 인공지능 모델의 고유한 문제 해결 능력을 평가하는 벤치마크로, 다양한 신규 문제에 대한 정답률을 측정하여 모델 간 비교를 가능하게 한다. 본 이미지 맥락에서는 각 모델이 평가에 소요된 총 비용과 그에 따른 점수를 축으로 하여 성능 차이를 시각화하는 데 사용되었다. 벤치마크 결과는 모델 설계와 비용 투입의 상관관계 판단에 근거 자료로 활용된다.
로그 스케일(Log scale)
로그 스케일은 가로축과 같이 값 범위가 넓을 때 지수적 변화를 균등하게 표현하기 위해 사용되는 축 표기법으로, 작은 값과 큰 값을 동시에 시각화할 때 원래 값의 곱셈 관계를 선형적으로 보여준다. 본 차트에서는 평가 비용을 로그 스케일로 표현하여 수천 달러에서 수만 달러 수준까지의 비용 차이를 한 눈에 비교하도록 설계되었다. 로그 스케일 사용은 비용 대비 성능의 기울기와 변곡을 더 명확히 파악하게 한다.
평가 비용(Evaluation cost)
평가 비용은 벤치마크를 수행하는 데 들어간 총 금전적 투입을 의미하며, 모델 호출 비용·인프라 사용료·사람 평가 비용 등이 합산되어 계산된다. 이미지에서는 Total evaluation cost (USD, log scale)로 표기되어 각 모델의 평가에 투입된 달러 액수를 가로축에 배치하였다. 비용은 모델 비교에서 단순 성능 수치와 함께 효율성을 평가하는 핵심 지표로 작동한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 25.수집 2026. 07. 25.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.