본문으로 건너뛰기

Claude Fable 5.1과 Mythos 5.1 출시

Fable 5.1은 최고 수준의 코딩 성능을 기록했지만 출력 토큰 증가와 안전 라우팅이 비용과 평가 해석을 복잡하게 만들었습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Anthropic은 코딩과 지식 작업을 겨냥한 Claude Fable 5.1과 Claude Mythos 5.1을 출시했으며, Fable 5.1은 Artificial Analysis Intelligence Index에서 66점을 기록해 당시 최고 점수에 올랐습니다. 입력과 출력의 기본 가격은 유지했지만 Cache Read 가격을 75% 낮췄고, Terminal-Bench-Science 0.1에서는 Fable 5의 24.7%를 넘어 52.6%를 기록했습니다. 다만 출력 토큰 사용량이 약 1.7배 늘어 작업당 비용은 오히려 20% 증가했으며, 평가 요청의 약 4%가 Fallback 모델로 처리돼 순수한 기본 모델 성능을 해석하기 어려웠습니다. 사용자는 코딩 능력과 문체 개선을 높이 평가했지만 Rate Limit, 안전장치 오탐, Fable과 Mythos의 라우팅 차이에 대해서는 엇갈린 반응을 보였습니다. 같은 기간 OpenAI Astra, World Labs Atlas, Qwen3.8-Max-0902와 Agent Harness·Memory 연구가 함께 부상하면서 모델 경쟁의 초점이 단일 모델 점수에서 비용, 안전 제어, 실행 환경을 포함한 시스템 성능으로 이동했습니다.

섹션별 상세

01
Anthropic은 장시간 위임 작업과 코딩을 겨냥해 Claude Fable 5.1과 Claude Mythos 5.1을 동시에 내놓았습니다. Fable 5.1은 복잡한 다단계 작업을 독립적으로 수행하고 막혔을 때 성공한 척하지 않는 동작을 목표로 하며, Mythos 5.1은 지식 작업용 쌍으로 배치됐습니다. 이 포지셔닝은 강력하지만 느리고 장황하며 사용하기 불편하다는 이전 Fable 5의 평가를 실행 가능한 Agent Worker로 바꾸려는 시도에 해당합니다.
02
Fable 5.1은 1M 토큰 Context Window와 Text·Image 입력을 지원하며 Artificial Analysis Intelligence Index에서 최대 노력 기준 66점을 기록했습니다. Terminal-Bench-Science 0.1 점수는 24.7%에서 52.6%로 상승했고, GDPval-AA v2는 1853 Elo로 Fable 5보다 130 높았으며, CursorBench 3.2.0에서는 73.4%를 기록했습니다. 이러한 수치는 과학 연구, 장기 코딩, 지식 작업과 컴퓨터 사용을 아우르는 여러 Agentic 평가에서 당시 최상위권 성능을 가리키지만, 일부 Knowledge Work 평가는 Opus 5와 사실상 비슷했습니다.
Claude Fable 5.1과 Fable 5, Opus 5, GPT-5.6 Sol의 Agentic 작업 성능을 비교한 표입니다.
Chart표는 Terminal-Bench-Science 0.1에서 Fable 5.1이 52.6%로 Fable 5의 24.7%와 Opus 5의 29.0%를 크게 앞서며, Terminal-Bench 4.0에서는 Mythos 5.1이 60.9%를 기록한 모습을 담고 있습니다. GDPval-AA v2는 Fable 5.1이 1853으로 가장 높고, CursorBench 3.2.0에서는 73.4%로 Fable 5의 70.5%와 Opus 5의 70.0%를 앞섭니다. 각주에는 Production Safeguards가 켜진 상태에서 안전 개입이 발생한 일부 작업이 Claude Opus 4.8 또는 Claude Opus 5로 완료됐다고 적혀 있어, 표의 점수가 순수한 기본 모델 성능만을 뜻하지 않을 수 있음을 보여줍니다.
03
기본 입력 가격 $10, 출력 가격 $50, Cache Write 가격 $12.5는 1M 토큰 기준으로 유지됐지만 Cache Read 가격은 $1.00에서 $0.25로 75% 낮아졌습니다. 긴 저장소, Scratchpad, 이전 단계와 도구 기록을 반복해서 읽는 Agent는 이 가격 인하로 입력 비용을 줄일 수 있지만, Fable 5.1의 출력 토큰 사용량이 약 1.7배로 늘면서 캐시 절감액 약 $1.40를 상쇄했습니다. 그 결과 최대 노력 설정의 작업당 비용은 $3.76으로 Fable 5보다 20% 높아졌고, 절대 성능과 지능 대비 비용 사이에 뚜렷한 긴장이 생겼습니다.
04
Artificial Analysis 평가에서는 Anthropic의 서버 측 Fallback이 적용됐고 Intelligence Index 출력 토큰의 약 4%가 Claude Opus 4.8 또는 Claude Opus 5에서 처리됐습니다. 커뮤니티는 Fable 5.1과 Mythos 5.1이 동일한 가중치를 사용하고 안전 분류기의 임계값이나 라우팅 정책만 다를 수 있다는 가설을 제기했으며, 일부 위험 요청이 더 큰 분류기와 Opus 계열로 넘어간다는 해석을 덧붙였습니다. 이 경로가 사실이라면 모델 이름별 벤치마크 점수는 기본 가중치의 능력뿐 아니라 안전 정책과 Fallback 동작까지 함께 반영하므로 결과 비교에 라우팅 정보를 명시해야 합니다.
05
사용자 반응은 코딩과 계획 수립 능력, 자연스러워진 문체, 장기간 실행되는 프로젝트 처리에서 긍정적이었고, 일부 개발자는 앱 생성과 Minecraft·SVG 제작 사례를 공유했습니다. 반면 Rate Limit, 이어쓰기 실패, 구독자 사용량 제한, 이론 수학이나 테스트 과정에서 발생한 Reverse Engineering·Cyber Safeguard 오탐이 실제 사용을 막는다는 불만도 나왔습니다. 따라서 API 기반 Agent 구축에는 Cache Read 가격 인하가 매력적이지만, 대화형 구독 제품에서는 접근 한도와 안전장치가 체감 가치를 제한할 수 있습니다.
06
같은 기간 OpenAI Astra는 사이버 보안 Preparedness Framework의 Critical 단계와 Recurrent Depth 구조를 둘러싼 안전성 논쟁을 일으켰고, World Labs Atlas는 한 장의 이미지나 소수의 휴대전화 촬영으로 장면을 재구성하고 카메라를 제어하는 World Model로 주목받았습니다. Alibaba의 Qwen3.8-Max-0902는 2.4T 파라미터와 1M Context Window, $2 입력·$6 출력 가격으로 WebDev Code Arena 1위에 올랐고, Agent Harness·Memory·Reward Hacking 연구도 함께 확산됐습니다. 이 흐름은 최전선 경쟁의 평가 기준이 모델의 단일 점수에서 장기 실행 비용, 안전 라우팅, 관찰 가능성, 도구 생태계와 결합된 시스템 성능으로 넓어졌음을 보여줍니다.

용어 해설

캐시 읽기 가격(Cache Read Pricing)
반복 요청에서 이미 저장된 입력 토큰을 다시 읽을 때 부과되는 비용입니다. Agent가 긴 문맥과 도구 기록을 여러 차례 재사용하는 환경에서는 전체 입력 비용에 큰 영향을 주며, 이번 출시에서는 1M 토큰당 $1.00에서 $0.25로 75% 낮아졌습니다.
Fallback Routing
안전 분류나 특정 조건에 따라 기본 모델의 요청을 다른 모델로 넘기는 처리 방식입니다. 이번 평가에서는 안전 플래그가 붙은 요청 일부가 Claude Opus 4.8 또는 Claude Opus 5로 전달됐고, 출력 토큰의 약 4%가 이 경로에서 처리됐습니다.
Agentic Workload
모델이 한 번의 답변에 그치지 않고 계획 수립, 코드 실행, 도구 호출, 결과 점검을 여러 단계로 이어가는 작업입니다. 이런 환경에서는 출력 토큰 수와 긴 입력의 캐시 재사용률, 장시간 실행 안정성이 작업당 비용과 성능을 함께 좌우합니다.
Enterprise Frontier Safeguards
기업 환경에서 Agent의 활동을 관찰하고 위험 신호를 관리하기 위한 Anthropic의 안전 제어 계층입니다. 교차 세션 관찰과 이상 징후 감시를 제공해 장기 실행 Agent의 배포 가능성을 높이려 하지만, 사용자는 이 과정에서 과도한 거부나 오탐을 경험할 수 있습니다.
Recurrent Depth
Transformer 블록이나 계산 경로를 반복 실행해 파라미터와 저장 공간을 절약하면서 유효 계산 깊이를 늘리는 구조적 방식입니다. Astra를 둘러싼 논쟁에서는 이 구조가 Chain-of-Thought 모니터링과 사고 과정의 사후 조사를 어렵게 만들 수 있는지가 핵심 쟁점으로 떠올랐습니다.

기술

  • Claude Fable 5.1
  • Claude Mythos 5.1
  • Claude Opus 4.8
  • Claude Opus 5
  • GPT-5.6 Sol
  • World Labs Atlas
  • OpenAI Astra
  • Qwen3.8-Max-0902
  • GLM-5.3
  • DeepSeek-V4-Pro-0813
  • RWKV-7 G1j
  • LongCat-2.0
  • vLLM-Omni
  • FastVideo
  • FastH3
  • Blender
  • OpenRouter
  • Cline

활용 사례

  • 장기 실행 코딩 Agent
  • 과학 연구 자동화
  • 지식 작업과 비즈니스 워크플로 자동화
  • 저장소와 도구 기록을 재사용하는 Multi-step Agent
  • 이미지 기반 주택 설계와 3D Walkthrough 생성
  • 소수의 사진을 이용한 장면 재구성과 Robotics용 Real2Sim
  • 전자상거래 운영 Agent 평가
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.