본문으로 건너뛰기

Claude Fable 5.1 벤치마크 비교

Claude Fable 5.1이 과학 연구·코딩·컴퓨터 사용·업무 자동화 벤치마크에서 비교 모델을 앞선 점수를 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이미지는 Claude Fable 5.1의 여러 벤치마크 점수를 Fable 5, Opus 5, GPT-5.6 Sol과 비교한 표입니다. Claude Fable 5.1은 Agentic scientific research에서 52.6%, Agentic coding에서 55.8%와 60.9%, Knowledge work에서 1853점을 기록해 표에 포함된 비교 모델보다 높게 표시됐습니다. OSWorld 2.0에서는 partial 77.9%, strict 41.7%, Humanity’s Last Exam에서는 도구 없이 60.9%, 도구 사용 시 65.0%를 기록했고 CursorBench 3.2.0에서는 73.4%였습니다. 다만 점수는 production safeguards가 활성화된 조건에서 산출됐으며, 주석은 안전장치가 개입한 일부 작업에서 모델별 결과가 0점이 되거나 다른 Opus 모델이 작업을 완료했다고 밝혀 벤치마크 비교에 조건이 붙는다고 설명합니다.

섹션별 상세

01
Claude Fable 5.1은 에이전트형 과학 연구와 코딩 평가에서 높은 점수를 기록했습니다. Terminal-Bench-Science 0.1에서 52.6%를 얻어 Fable 5의 24.7%, Opus 5의 29.0%, GPT-5.6 Sol의 22.4%보다 높았습니다. Terminal-Bench 4.0에서는 55.8%, Myths 5.1에서는 60.9%로 표시돼 과학·코딩 작업을 여러 단계로 수행하는 능력이 비교 표의 핵심 차이로 나타났습니다.
02
Claude Fable 5.1은 지식 작업과 컴퓨터 조작에서도 비교 모델보다 높은 수치를 기록했습니다. GDPval-AA v2에서 1853점을 얻어 Fable 5의 1723점, Opus 5의 1824점, GPT-5.6 Sol의 1711점을 앞섰고, OSWorld 2.0에서는 partial 조건 77.9%, strict 조건 41.7%였습니다. Humanity’s Last Exam에서도 도구 미사용 60.9%, 도구 사용 65.0%를 기록해 도구 연결 여부에 따른 추론 성능 차이를 함께 확인할 수 있습니다.
03
표의 우위는 모든 평가가 동일한 조건에서 단순히 모델 자체의 능력만 측정했다는 뜻으로 해석하기 어렵습니다. 주석에 따르면 Claude Fable 5.1은 production safeguards를 켠 상태에서 평가됐고, 안전장치가 개입한 작업에서는 OSWorld 2.0과 AutomationBench의 일부 모델 점수가 0점으로 처리됐습니다. 또한 Terminal-Bench-Science 0.1의 모델별 표준 오차가 ±3.5~4.5점이며, AutomationBench 수치는 이전 공개 결과와 직접 비교할 수 없는 별도 작업 릴리스라는 제한이 함께 제시됐습니다.

이미지 분석

Claude Fable 5.1과 Fable 5, Opus 5, GPT-5.6 Sol의 벤치마크 점수를 비교한 표입니다.
Chart

표는 Agentic scientific research, Agentic coding, Knowledge work, Computer use, Multidisciplinary reasoning, Business workflows, CursorBench 기반 Agentic coding의 결과를 모델별 열로 정리합니다. Claude Fable 5.1 열에는 Terminal-Bench-Science 0.1 52.6%, GDPval-AA v2 1853점, OSWorld 2.0 partial 77.9%와 strict 41.7%, Humanity’s Last Exam 도구 사용 65.0%, CursorBench 3.2.0 73.4%가 표시되어 있습니다. 하단 주석은 production safeguards, 표준 오차, OSWorld 2.0 작업 릴리스 차이가 점수 해석에 영향을 준다고 밝힙니다.

Claude Fable 5.1과 Fable 5, Opus 5, GPT-5.6 Sol의 벤치마크 점수를 비교한 표입니다.

Claude Fable 5.1의 과학 연구, 코딩, 지식 작업, 컴퓨터 사용 및 업무 자동화 성능을 다른 모델과 비교한 벤치마크 표입니다.
Chart

두 번째 이미지는 첫 번째 이미지와 같은 벤치마크 표를 미리보기 URL로 제공한 것입니다. Claude Fable 5.1은 표에 포함된 대부분의 항목에서 Fable 5, Opus 5, GPT-5.6 Sol보다 높은 수치로 표시되지만, 안전장치 개입과 평가 작업 버전 차이 때문에 모든 수치를 직접적인 모델 서열로 읽는 데에는 주의가 필요합니다.

Claude Fable 5.1의 과학 연구, 코딩, 지식 작업, 컴퓨터 사용 및 업무 자동화 성능을 다른 모델과 비교한 벤치마크 표입니다.

용어 해설

에이전트형 과학 연구(Agentic scientific research)
모델이 과학 연구 과제를 단순히 답변하는 데 그치지 않고 도구를 사용해 탐색, 추론, 검증 같은 여러 단계를 수행하는 방식입니다. 표에서는 Terminal-Bench-Science 0.1 점수로 이 능력을 측정합니다.
OSWorld 2.0
모델이 실제 컴퓨터 환경에서 화면을 읽고 애플리케이션을 조작하며 주어진 작업을 끝내는 능력을 평가하는 벤치마크입니다. 표는 partial과 strict 조건을 나눠 Claude 계열의 작업 성공률을 비교합니다.
Humanity’s Last Exam
여러 학문 분야의 어려운 문제를 통해 모델의 종합적 추론 능력을 평가하는 벤치마크입니다. 표에서는 도구를 사용하지 않은 조건과 도구를 사용한 조건을 분리해 점수를 기록합니다.
프로덕션 안전장치(production safeguards)
실제 서비스 환경에서 모델의 행동을 제한하거나 특정 작업을 차단하는 운영상의 안전 제어 장치입니다. 이미지의 주석은 이 안전장치가 벤치마크 수행과 점수에 영향을 줄 수 있다고 설명합니다.
AutomationBench
비즈니스 업무 흐름을 자동화하는 모델의 수행 능력을 평가하는 벤치마크입니다. 표에서는 Claude Fable 5.1이 31.4%, Fable 5가 17.1%, Opus 5가 26.9%를 기록한 것으로 표시됩니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.