TL;DR
이 이미지는 Baba 퍼즐 벤치에서 인간과 여러 LLM의 시간당 누적 해결 과제를 비교한 라인 차트로, 입력된 퍼즐 상태에 대해 모델이 내부 추론과 계획을 통해 행동을 생성하고 시간이 지남에 따라 누적 해결 수가 늘어나는 과정을 시각화하고 있다. 차트 상단에는 Claude Fable 5가 인간보다 동일 과제에 도달하는 속도에서 '4.2x faster'로 표기되어 있어 시간 대비 처리량 측면에서 주목할 만한 차이가 존재함을 보여준다. 여러 모델의 곡선이 서로 다른 기울기를 보인 점은 추론·탐색 전략과 장기 계획 능력의 차이를 반영하며, 단순 성공률 외에 시간과 자원 소비를 함께 고려해야 하는 트레이드오프가 존재함을 시사한다.
섹션별 상세
이미지 분석

차트는 가로축을 시간(1분에서 10시간 범위)으로 설정하고 세로축을 해결된 과제 수로 설정해 모델별 누적 성능을 시각화했다. 특정 지점에서는 인간 곡선과 모델 곡선 사이에 속도 차 주석이 있으며 몇몇 모델이 시간이 지남에 따라 인간 곡선을 따라잡거나 근접하는 패턴이 관찰된다. 이 시각 자료는 퍼즐형 벤치에서 시간 대비 처리량과 모델 간 트레이드오프를 수치적으로 비교하는 목적으로 제작된 것으로 판단된다.
시간 축에 따른 누적 해결 과제 수를 나타내는 라인 차트로 인간과 여러 언어 모델의 성과를 비교하고 Claude Fable 5에 '4.2x faster' 주석을 붙였다.
용어 해설
- Baba Is You
- — Baba Is You는 규칙을 조작해 퍼즐을 푸는 인디 게임으로, 상태와 규칙의 조합으로 문제 해결 경로가 달라진다. 벤치마킹에서는 고정된 평가 환경에서 에이전트가 주어진 맵을 어떻게 해석하고 규칙을 조합해 목표에 도달하는지로 성능을 측정한다. 게임의 구조적 복잡성 때문에 추론 능력, 계획 능력, 그리고 환경 모델링을 동시에 시험하는 지표로 사용된다.
- Tasks Solved
- — Tasks Solved는 주어진 시간 동안 에이전트가 성공적으로 완료한 퍼즐·문제의 누적 개수를 의미한다. 입력으로 문제 상태를 받고 내부 추론·계획 과정을 거쳐 목표 상태에 도달하면 카운트가 증가하는 방식으로 측정된다. 시간 축에 따른 누적 그래프는 속도와 효율성, 안정성 차이를 동시에 드러내는 벤치마크 지표로 활용된다.
- Time-to-Solve
- — Time-to-Solve는 개별 과제나 누적 과제를 해결하는 데 걸리는 실제 경과 시간을 의미하며, 모델의 추론 속도와 탐색 효율을 직접적으로 반영한다. 입력된 퍼즐 상태에서 행동을 선택하고 계획을 실행해 목표에 도달할 때까지의 전체 지연과 반복 시도를 포함한다. 벤치 차트에서는 동일한 과제 수에 도달하기 위한 시간 비교로 모델 간 성능을 평가한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

