TL;DR
tbench 비교 차트에서 Claude Code + Fable 5가 83.8%로 가장 높은 점수를 기록했고, Codex + GPT-5.5가 83.1%로 뒤를 이었습니다. Our orchestrator는 78.0%로 7위에 올랐지만 거부 응답을 제외하면 80.5%로 집계됩니다. 이 차이는 에이전트의 작업 거부 여부를 포함할지에 따라 벤치마크 점수와 시스템 간 격차의 해석이 달라짐을 보여줍니다.
섹션별 상세
이미지 분석

차트는 Claude Code + Fable 5의 83.8%를 최고 점수로 두고 여러 에이전트·모델 조합의 순위를 비교합니다. Our orchestrator는 78.0%로 7위에 표시되지만, 거부 응답을 제외하면 80.5%로 올라가 상위권과의 격차가 줄어드는 결과를 함께 보여줍니다.
AI 코딩 시스템별 벤치마크 점수와 Our orchestrator의 거부 응답 제외 점수를 비교한 막대 차트입니다.
용어 해설
- 오케스트레이터(Orchestrator)
- — 여러 AI 코딩 에이전트나 모델의 작업 흐름을 조정하는 구성요소입니다. 이 차트에서는 특정 모델 조합을 실행하는 시스템과 비교 대상으로 표시됐으며, 거부 응답을 제외하면 점수가 달라지는 결과가 함께 제시됐습니다.
- 거부 응답(Refusal)
- — 모델이나 에이전트가 작업을 수행하지 않고 요청을 거절하는 응답입니다. 차트는 거부 응답을 포함한 점수와 이를 제외한 점수의 차이를 비교하며, 해당 오케스트레이터의 점수가 78.0%에서 80.5%로 올라간다고 표시합니다.
- 벤치마크(Benchmark)
- — 여러 시스템을 동일한 평가 기준으로 비교하는 측정 방식입니다. 차트는 Claude Code, Codex, Terminus 2, Cursor CLI, mini-SWE-agent 등의 조합을 백분율 점수와 순위로 나란히 비교합니다.
언급된 도구
tbench 비교 차트에 포함된 AI 코딩 에이전트
tbench 비교 차트에 포함된 AI 코딩 에이전트
tbench 비교 차트에 포함된 AI 코딩 도구
tbench 비교 차트에 포함된 시스템
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.