TL;DR
이미지는 Claude Fable 5.1의 여러 벤치마크 점수를 Fable 5, Opus 5, GPT-5.6 Sol과 비교한 표입니다. Claude Fable 5.1은 Agentic scientific research에서 52.6%, Agentic coding에서 55.8%와 60.9%, Knowledge work에서 1853점을 기록해 표에 포함된 비교 모델보다 높게 표시됐습니다. OSWorld 2.0에서는 partial 77.9%, strict 41.7%, Humanity’s Last Exam에서는 도구 없이 60.9%, 도구 사용 시 65.0%를 기록했고 CursorBench 3.2.0에서는 73.4%였습니다. 다만 점수는 production safeguards가 활성화된 조건에서 산출됐으며, 주석은 안전장치가 개입한 일부 작업에서 모델별 결과가 0점이 되거나 다른 Opus 모델이 작업을 완료했다고 밝혀 벤치마크 비교에 조건이 붙는다고 설명합니다.
섹션별 상세
이미지 분석

표는 Agentic scientific research, Agentic coding, Knowledge work, Computer use, Multidisciplinary reasoning, Business workflows, CursorBench 기반 Agentic coding의 결과를 모델별 열로 정리합니다. Claude Fable 5.1 열에는 Terminal-Bench-Science 0.1 52.6%, GDPval-AA v2 1853점, OSWorld 2.0 partial 77.9%와 strict 41.7%, Humanity’s Last Exam 도구 사용 65.0%, CursorBench 3.2.0 73.4%가 표시되어 있습니다. 하단 주석은 production safeguards, 표준 오차, OSWorld 2.0 작업 릴리스 차이가 점수 해석에 영향을 준다고 밝힙니다.
Claude Fable 5.1과 Fable 5, Opus 5, GPT-5.6 Sol의 벤치마크 점수를 비교한 표입니다.

두 번째 이미지는 첫 번째 이미지와 같은 벤치마크 표를 미리보기 URL로 제공한 것입니다. Claude Fable 5.1은 표에 포함된 대부분의 항목에서 Fable 5, Opus 5, GPT-5.6 Sol보다 높은 수치로 표시되지만, 안전장치 개입과 평가 작업 버전 차이 때문에 모든 수치를 직접적인 모델 서열로 읽는 데에는 주의가 필요합니다.
Claude Fable 5.1의 과학 연구, 코딩, 지식 작업, 컴퓨터 사용 및 업무 자동화 성능을 다른 모델과 비교한 벤치마크 표입니다.
용어 해설
- 에이전트형 과학 연구(Agentic scientific research)
- — 모델이 과학 연구 과제를 단순히 답변하는 데 그치지 않고 도구를 사용해 탐색, 추론, 검증 같은 여러 단계를 수행하는 방식입니다. 표에서는 Terminal-Bench-Science 0.1 점수로 이 능력을 측정합니다.
- OSWorld 2.0
- — 모델이 실제 컴퓨터 환경에서 화면을 읽고 애플리케이션을 조작하며 주어진 작업을 끝내는 능력을 평가하는 벤치마크입니다. 표는 partial과 strict 조건을 나눠 Claude 계열의 작업 성공률을 비교합니다.
- Humanity’s Last Exam
- — 여러 학문 분야의 어려운 문제를 통해 모델의 종합적 추론 능력을 평가하는 벤치마크입니다. 표에서는 도구를 사용하지 않은 조건과 도구를 사용한 조건을 분리해 점수를 기록합니다.
- 프로덕션 안전장치(production safeguards)
- — 실제 서비스 환경에서 모델의 행동을 제한하거나 특정 작업을 차단하는 운영상의 안전 제어 장치입니다. 이미지의 주석은 이 안전장치가 벤치마크 수행과 점수에 영향을 줄 수 있다고 설명합니다.
- AutomationBench
- — 비즈니스 업무 흐름을 자동화하는 모델의 수행 능력을 평가하는 벤치마크입니다. 표에서는 Claude Fable 5.1이 31.4%, Fable 5가 17.1%, Opus 5가 26.9%를 기록한 것으로 표시됩니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.