본문으로 건너뛰기

개인 벤치마크로 테스트한 코딩 에이전트 Fable의 성능 분석

실제 프로젝트 버그를 기반으로 구축한 비공개 벤치마크 환경에서 코딩 에이전트 Fable의 성능을 검증한 사례.

주요 논점

01중립다수

Fable은 3/4 성공으로 준수한 성능을 보였으나, 복합 버그 처리에 한계를 드러냄.

실용적 조언

  • 코딩 에이전트 테스트 시, 패턴 매칭을 방지하기 위해 의도적인 오답(decoy)을 코드에 포함하여 추론 능력을 검증하라.

섹션별 상세

작성자는 과거 프로젝트의 실제 버그를 기반으로 비공개 벤치마크를 구축했다. Playwright 테스트를 Docker 컨테이너 내에서 실행하여 에이전트가 테스트 코드를 직접 보지 못하도록 격리했다. 단 한 번의 시도와 재시도 없는 환경을 통해 에이전트의 순수 해결 능력을 측정했다. 이는 데이터 오염을 방지하고 실제 개발 환경과 유사한 검증을 가능하게 한다.
Fable은 총 4개의 작업(난이도: 중, 중, 상, 극상) 중 3개를 성공적으로 해결했다. 특히 '상' 난이도의 웹훅 이벤트 손실 문제에서 기존 모델이 실패한 작업을 40줄의 diff로 해결했다. 이는 에이전트가 단순 패턴 매칭을 넘어 코드의 동작을 추적하고 있음을 시사한다.
Fable은 작성자가 의도적으로 심어둔 가짜 코드(decoy)를 무시하지 않고 오히려 이를 활용해 합리적인 대안을 제시했다. 그러나 '극상' 난이도의 복합 버그 작업에서는 두 개의 독립적인 버그 중 하나만 해결했다. 에이전트가 하나의 근본 원인으로 두 증상을 설명하려 시도하다가 다른 버그를 놓치는 할루시네이션을 보였다.

언급된 도구

Fable추천

코딩 에이전트

Playwright추천

웹 브라우저 자동화 및 테스트

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 11.수집 2026. 06. 11.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.