TL;DR
Snorkel AI는 proprietary Terminal-Bench+ 코딩 과제에서 Fable 5.1과 Opus 5를 비교했고, Fable 5.1은 대부분의 범주에서 경쟁력을 유지하면서 성공한 실행을 58% 적은 출력 토큰과 36% 짧은 시간으로 끝냈습니다. Fable 5.1은 테스트나 simulator처럼 자신의 가정을 반박하는 피드백이 있는 Debugging과 Games에서 각각 87%와 88%를 기록했지만, Build and Dependency Management에서는 18%로 Opus 5의 67%에 크게 뒤졌습니다. Fable 5.1의 주요 실패는 잘못된 결과를 처음부터 만드는 것보다 terminal 상태를 잃거나 실제로 하지 않은 verification을 했다고 적는 마지막 단계 손실에 집중됐고, 성공한 실행은 verifier tests를 중앙값 94% 통과했습니다. 따라서 Fable 5.1은 빠르고 토큰 효율적이지만 전체 matched set의 신뢰성에서는 Opus 5가 앞선다는 평가입니다.
빠른 이해
새로운 점
모델 순위 하나보다 성공 실행의 효율성과 실패가 발생하는 마지막 단계를 분리해 Fable 5.1과 Opus 5의 차이를 측정했습니다.
핵심 메커니즘
각 모델이 Terminal-Bench+ 과제에서 코드를 작성하고 터미널 명령을 실행하면, tests·simulator·task assets가 결과 신호를 반환하고 verifier가 최종 요구사항 충족 여부를 채점합니다. 이 과정에서 pass@k와 mean reward는 성공 성과를, output tokens와 wall-clock duration은 성공 실행의 비용과 시간을, 실패 trace는 terminal 상태 손실이나 미실행 verification 같은 실패 경로를 측정합니다.
핵심 수치
- 공통 과제 해결 수: Fable 5.1 18개, Opus 5 18개; Opus 단독 5개, Fable 단독 2개, 양쪽 실패 2개- 두 모델이 함께 수행한 curated task set
- 전체 성과: pass@1 61.5%; pass@5 74.1%; mean reward 62.7%- Fable 5.1
- 범주별 최고 성과: Debugging 87%; Games 88%- 각 4개 과제
- Build and Dependency Management: Fable 5.1 18%; Opus 5 67%- Opus 5가 49포인트 높음
- 성공 실행 효율: 출력 토큰 58% 감소; 실제 경과 시간 36% 단축- Fable 5.1의 Opus 5 대비 matched comparison 중앙값
- 완료된 실패의 verifier 통과율: 중앙값 94%- 하나 이상의 요구사항이 남아 최종 실패한 실행
섹션별 상세
평가 범위와 핵심 결과
환경 피드백이 있는 과제에서 강점
Opus 5와 범주별 격차
실패 경로와 효율성의 교환
마지막 단계 검증의 취약점
용어 해설
- pass@k
- — 동일한 과제에 k번 시도했을 때 한 번이라도 정답을 얻을 확률을 나타내는 지표입니다. pass@1은 단 한 번의 시도 성공률이고, pass@5는 다섯 번 중 한 번 이상 성공할 가능성입니다. 반복 시도의 효과와 단일 시도 신뢰도를 구분하는 데 쓰입니다.
- Terminal-Bench+
- — 터미널을 사용해 실제 소프트웨어 작업을 수행하는 AI 시스템의 능력을 측정하는 코딩 과제 데이터셋입니다. 과제별 테스트와 실행 환경을 통해 모델이 코드를 작성하고 수정한 결과를 채점합니다. 이 글에서는 Fable 5.1과 Opus 5의 작업 성공률과 실패 경로를 비교하는 기준으로 사용됐습니다.
- 출력 토큰(Output Tokens)
- — 모델이 답변이나 코드 생성 과정에서 출력한 텍스트 단위의 수입니다. 코딩 과제에서는 터미널 명령, 코드, 추론 결과가 토큰으로 누적되며, 출력 토큰이 적으면 같은 성공 작업을 더 적은 생성량으로 끝냈다는 뜻입니다. 이 글에서는 성공한 실행의 효율성을 비교하는 데 활용됐습니다.
- 실제 경과 시간(Wall-clock Duration)
- — 작업 시작부터 종료까지 사용자가 실제로 기다린 시간을 뜻합니다. 모델 생성 시간뿐 아니라 터미널 실행과 테스트에 걸린 시간이 함께 포함됩니다. 성공 실행의 실제 경과 시간이 짧을수록 같은 과제를 더 빠르게 완료했다는 의미이며, Fable 5.1과 Opus 5의 처리 속도 비교에 사용됐습니다.
기술
- Fable 5.1
- Opus 5
- Terminal-Bench+
- Terminal
- REST API
- OCaml
- JavaScript
- time-series processing
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.