TL;DR
이미지는 Claude Fable 5.1을 Fable 5, Opus 5, GPT-5.6 Sol과 여러 AI 작업 벤치마크에서 비교한 표를 담고 있습니다. Claude Fable 5.1은 Agentic scientific research에서 52.6%, Agentic coding에서 55.8%와 60.9%, GDPval-AA v2에서 1853, CursorBench 3.2.0에서 73.4%를 기록해 표에 나온 항목 대부분에서 가장 높은 수치를 냈습니다. Computer use는 partial 조건에서 77.9%, strict 조건에서 41.7%였고, Humanity’s Last Exam은 도구 미사용 60.9%, 도구 사용 65.0%였습니다. 다만 운영 안전장치가 개입한 OSWorld 2.0과 AutomationBench 과제에서는 Fable 5.1과 Fable 5의 점수가 0으로 처리됐으며, 일부 비교 수치는 과제 버전과 재실행 조건의 차이 및 표준오차를 함께 고려해야 합니다.
섹션별 상세
이미지 분석

표는 과학 연구, 에이전트형 코딩, 지식 업무, 컴퓨터 사용, 다학제 추론, 비즈니스 workflow를 행으로 두고 모델별 점수를 나란히 배치합니다. Claude Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%, GDPval-AA v2에서 1853, CursorBench 3.2.0에서 73.4%를 기록했으며 Humanity’s Last Exam에서는 도구 사용 조건에서 65.0%를 냈습니다. 하단 주석은 운영 안전장치 개입 시 OSWorld 2.0과 AutomationBench 일부 점수가 0으로 처리됐고, OSWorld 수치는 과제 릴리스 차이 때문에 기존 공개 결과와 직접 비교하기 어렵다고 밝힙니다.
Claude Fable 5.1과 Fable 5, Opus 5, GPT-5.6 Sol의 AI 작업 벤치마크 점수를 비교한 표입니다.

두 번째 이미지는 동일한 표를 다른 호스트 URL에서 제공하며, Claude Fable 5.1과 세 비교 모델의 벤치마크 수치를 함께 담고 있습니다. 표의 핵심 수치는 Agentic scientific research 52.6%, Agentic coding 55.8%와 60.9%, Computer use partial 77.9%, Business workflows 31.4%, CursorBench 73.4%입니다. 각주에는 Terminal-Bench의 표준오차가 모델당 ±3.5~4.5점이며, OSWorld 2.0의 재실행 조건이 과거 공개 결과와 직접 비교되지 않는다는 제한이 적혀 있습니다.
첫 번째 이미지와 동일한 Claude Fable 5.1 벤치마크 비교표입니다.
용어 해설
- 에이전트형 과학 연구(Agentic scientific research)
- — AI가 과학 연구 과제를 단순 질의응답이 아니라 도구 호출과 여러 단계의 추론으로 수행하는 평가 영역이다. 이 표에서는 Terminal-Bench-Science 0.1 점수로 연구 수행 능력을 비교한다.
- 에이전트형 코딩(Agentic coding)
- — AI가 코드를 생성하는 데 그치지 않고 터미널이나 개발 도구를 사용해 작업을 이어가는 코딩 방식이다. 표에서는 Terminal-Bench 4.0, Mythos 5.1, CursorBench 3.2.0의 결과로 측정한다.
- 운영 환경 안전장치(Production safeguards)
- — 모델이 실제 서비스 환경에서 위험한 작업을 수행하지 않도록 제한하거나 개입하는 보호 절차다. 이미지의 주석은 안전장치가 개입한 과제에서 일부 모델의 점수가 0으로 처리됐다고 설명한다.
- Humanity’s Last Exam
- — 여러 학문 분야의 문제를 이용해 모델의 종합적인 추론 능력을 평가하는 벤치마크다. 표는 도구를 사용하지 않은 조건과 도구를 사용한 조건을 나누어 점수를 제시한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.