TL;DR
Artificial Analysis Intelligence Index v4.11은 GDPval-AA v2, GPQA Diamond, SciCode 등 여러 평가 결과를 통합해 AI 모델의 종합 점수를 비교합니다. 차트에서는 Claude Opus 4.1이 63점으로 가장 높고 Claude Opus 4가 62점, GPT-5와 Grok 4.0, Kimi K3가 61점으로 뒤따릅니다. GLM-5.3, Qwen3 계열, DeepSeek V3.1 등도 함께 비교되며 전체 점수 범위는 51점에서 63점입니다. 전구 아이콘은 추론 모델을 별도로 표시해 종합 성능과 모델 유형을 한 차트에서 구분합니다.
섹션별 상세
이미지 분석

차트는 Claude Opus 4.1을 63점으로 가장 높게 배치하고 Claude Opus 4, GPT-5, Grok 4.0, Kimi K3 등을 61점 안팎으로 보여줍니다. 평가 항목에는 GDPval-AA v2, GPQA Diamond, SciCode, Humanity's Last Exam 등이 포함되며, 전구 아이콘은 추론 모델을 구분합니다. 단일 테스트 점수가 아니라 여러 평가를 합산한 지수라는 점에서 모델의 종합 순위 비교에 쓰이는 자료입니다.
Artificial Analysis Intelligence Index v4.11에서 여러 언어 모델의 종합 벤치마크 점수를 막대그래프로 비교한 차트입니다.

동일한 차트가 다른 이미지 URL로 제공되며, 14개 모델의 점수가 51점에서 63점 사이에 놓여 있습니다. Claude Opus 4.1이 63점으로 가장 높고 DeepSeek V3.1이 51점으로 가장 낮으며, GPT-5와 Kimi K3는 61점으로 표시됩니다. 차트 상단의 평가 목록은 점수가 여러 전문·추론 벤치마크를 결합한 결과임을 밝힙니다.
Artificial Analysis Intelligence Index의 모델별 종합 점수와 순위를 색상 막대로 나타낸 차트입니다.
용어 해설
- 벤치마크(Benchmark)
- — AI 모델의 능력을 동일한 평가 기준과 데이터셋으로 측정해 서로 비교하는 방법입니다. 이 이미지에서는 여러 평가 과목의 결과를 하나의 점수로 통합해 모델 순위를 산출하는 기준으로 쓰였습니다.
- 추론 모델(Reasoning Model)
- — 복잡한 문제를 풀 때 중간 추론 과정을 더 오래 수행하도록 설계된 언어 모델입니다. 이미지의 전구 아이콘은 일반 응답 모델과 구분되는 추론 모델임을 나타내며, 점수 비교에서 모델의 문제 해결 특성을 함께 보여줍니다.
- AI 지수(AI Index)
- — 여러 벤치마크 결과를 하나의 종합 점수로 묶어 AI 모델의 상대적 성능을 비교하는 지표입니다. Artificial Analysis Intelligence Index는 GDPval-AA v2, GPQA Diamond, CritiPt 등 복수 평가를 반영해 모델별 점수를 제시합니다.
언급된 도구
여러 AI 벤치마크 결과를 통합해 모델별 종합 점수와 순위를 산출하는 지수
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.