본문으로 건너뛰기

Claude Fable 5.1 벤치마크 비교표

Claude Fable 5.1이 과학 연구·코딩·업무 벤치마크에서 경쟁 모델보다 높은 점수를 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이미지는 Claude Fable 5.1을 Fable 5, Opus 5, GPT-5.6 Sol과 여러 AI 작업 벤치마크에서 비교한 표를 담고 있습니다. Claude Fable 5.1은 Agentic scientific research에서 52.6%, Agentic coding에서 55.8%와 60.9%, GDPval-AA v2에서 1853, CursorBench 3.2.0에서 73.4%를 기록해 표에 나온 항목 대부분에서 가장 높은 수치를 냈습니다. Computer use는 partial 조건에서 77.9%, strict 조건에서 41.7%였고, Humanity’s Last Exam은 도구 미사용 60.9%, 도구 사용 65.0%였습니다. 다만 운영 안전장치가 개입한 OSWorld 2.0과 AutomationBench 과제에서는 Fable 5.1과 Fable 5의 점수가 0으로 처리됐으며, 일부 비교 수치는 과제 버전과 재실행 조건의 차이 및 표준오차를 함께 고려해야 합니다.

섹션별 상세

01
표는 Claude Fable 5.1을 Fable 5, Opus 5, GPT-5.6 Sol과 과학 연구 및 에이전트형 코딩 과제에서 비교합니다. Claude Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%를 기록해 Fable 5의 24.7%, Opus 5의 29.0%, GPT-5.6 Sol의 22.4%보다 높았습니다. 도구를 사용해 실제 작업 단계를 수행하는 평가에서 모델 간 차이를 비교할 수 있다는 점이 핵심입니다.
02
Claude Fable 5.1은 Terminal-Bench 4.0에서 55.8%, Mythos 5.1에서 60.9%를 기록했으며 CursorBench 3.2.0에서도 73.4%를 냈습니다. 비교 대상의 CursorBench 점수는 Fable 5 70.5%, Opus 5 70.0%, GPT-5.6 Sol 67.2%였습니다. 이는 코드 작성 능력뿐 아니라 도구와 실행 환경을 연결해 작업을 완료하는 평가에서 높은 점수가 나온 결과입니다.
03
지식 업무와 컴퓨터 사용에서는 Claude Fable 5.1이 GDPval-AA v2에서 1853, OSWorld 2.0에서 partial 77.9%와 strict 41.7%를 기록했습니다. Humanity’s Last Exam에서는 도구 없이 60.9%, 도구 사용 시 65.0%였고, AutomationBench에서는 31.4%였습니다. 다만 주석에 따르면 안전장치가 개입한 OSWorld 2.0 및 AutomationBench 과제는 Fable 5.1과 Fable 5의 점수가 0으로 처리됐으므로 표의 수치를 무조건적인 작업 성공률로 해석하기는 어렵습니다.

이미지 분석

Claude Fable 5.1과 Fable 5, Opus 5, GPT-5.6 Sol의 AI 작업 벤치마크 점수를 비교한 표입니다.
Chart

표는 과학 연구, 에이전트형 코딩, 지식 업무, 컴퓨터 사용, 다학제 추론, 비즈니스 workflow를 행으로 두고 모델별 점수를 나란히 배치합니다. Claude Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%, GDPval-AA v2에서 1853, CursorBench 3.2.0에서 73.4%를 기록했으며 Humanity’s Last Exam에서는 도구 사용 조건에서 65.0%를 냈습니다. 하단 주석은 운영 안전장치 개입 시 OSWorld 2.0과 AutomationBench 일부 점수가 0으로 처리됐고, OSWorld 수치는 과제 릴리스 차이 때문에 기존 공개 결과와 직접 비교하기 어렵다고 밝힙니다.

Claude Fable 5.1과 Fable 5, Opus 5, GPT-5.6 Sol의 AI 작업 벤치마크 점수를 비교한 표입니다.

첫 번째 이미지와 동일한 Claude Fable 5.1 벤치마크 비교표입니다.
Chart

두 번째 이미지는 동일한 표를 다른 호스트 URL에서 제공하며, Claude Fable 5.1과 세 비교 모델의 벤치마크 수치를 함께 담고 있습니다. 표의 핵심 수치는 Agentic scientific research 52.6%, Agentic coding 55.8%와 60.9%, Computer use partial 77.9%, Business workflows 31.4%, CursorBench 73.4%입니다. 각주에는 Terminal-Bench의 표준오차가 모델당 ±3.5~4.5점이며, OSWorld 2.0의 재실행 조건이 과거 공개 결과와 직접 비교되지 않는다는 제한이 적혀 있습니다.

첫 번째 이미지와 동일한 Claude Fable 5.1 벤치마크 비교표입니다.

용어 해설

에이전트형 과학 연구(Agentic scientific research)
AI가 과학 연구 과제를 단순 질의응답이 아니라 도구 호출과 여러 단계의 추론으로 수행하는 평가 영역이다. 이 표에서는 Terminal-Bench-Science 0.1 점수로 연구 수행 능력을 비교한다.
에이전트형 코딩(Agentic coding)
AI가 코드를 생성하는 데 그치지 않고 터미널이나 개발 도구를 사용해 작업을 이어가는 코딩 방식이다. 표에서는 Terminal-Bench 4.0, Mythos 5.1, CursorBench 3.2.0의 결과로 측정한다.
운영 환경 안전장치(Production safeguards)
모델이 실제 서비스 환경에서 위험한 작업을 수행하지 않도록 제한하거나 개입하는 보호 절차다. 이미지의 주석은 안전장치가 개입한 과제에서 일부 모델의 점수가 0으로 처리됐다고 설명한다.
Humanity’s Last Exam
여러 학문 분야의 문제를 이용해 모델의 종합적인 추론 능력을 평가하는 벤치마크다. 표는 도구를 사용하지 않은 조건과 도구를 사용한 조건을 나누어 점수를 제시한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.