TL;DR
네 모델의 비교 표는 acceptance와 judge 점수를 합산한 composite 점수로 Codex gpt-5.5가 96.1로 가장 높게 평가되었고 Claude Fable 5와 Claude Opus 4.8이 근소한 차이로 뒤를 이었다. 동일 표에서 wall time과 추정 API 비용도 함께 제시되어 Codex gpt-5.5가 17분으로 가장 빠르고 Gemini 3 Pro가 $3.21로 가장 저렴했음을 확인할 수 있다. acceptance 점수는 대체로 비슷했으나 judge 점수에서 모델별 세부 품질 차이가 관찰되어 단순 합산 점수만으로는 세부적 출력 품질을 온전히 판단하기 어렵다. 따라서 모델 선택 시에는 composite 성능과 함께 실행 지연 및 운영 비용, 그리고 인간 판정 기반의 질적 지표를 함께 고려해야 한다.
섹션별 상세


용어 해설
- Composite Score
- — 여러 평가 지표를 가중 합산해 산출한 단일 점수로서, 본 표에서는 acceptance와 judge 점수 등을 종합해 0~100 범위로 환산한 값이다. 입력 성능과 판정 점수를 결합하여 모델 전반의 성능을 비교하는 데 쓰이며, 개별 지표의 균형을 반영한다.
- Wall Time
- — 작업을 시작한 시점부터 종료 시점까지 실제 소요된 시간으로서, 본 표에서는 단일 실행(run)당 전체 처리에 걸린 분 단위 시간을 표시했다. 추론 파이프라인 구성, 멀티스레딩 여부, 외부 API 호출 지연 등 서비스 레이턴시 영향을 모두 포함한다.
- API Cost / Run
- — 한 번의 워크플로 실행에 소요된 추정 API 비용으로서, 호출한 모델의 토큰 사용량과 요금 구조에 기반해 달러 단위로 계산된 금액을 의미한다. 비용 대비 성능 분석과 운영 예산 추정에 직접적으로 사용된다.
- Judge Score
- — 패널 혹은 시스템이 제공한 최대값 기준 평가 점수로서, 본 표에서는 패널 기준 30점 만점 중 획득한 수치로 표기되어 모델의 질적 판단을 반영한다. 자동화된 정량 지표와는 달리 인간 패널의 주관적 판단이 개입될 수 있다.
- Acceptance
- — 최대점수 기준으로 채택된 응답의 비율 또는 점수로서, 본 표에서는 70점 만점 기준 값으로 표기되어 모델 출력의 허용성 또는 만족도를 나타낸다. 단일 지표만으로는 품질을 완전하게 설명하지 못하므로 judge 점수 등과 함께 해석해야 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.