본문으로 건너뛰기

Baba는 해결되었지만 그 비용은 무엇인가

Baba 퍼즐 벤치에서 인간과 여러 LLM의 시간당 해결 성과가 비교되었으며 차트는 Claude Fable 5가 4.2배 빠르다고 표기되어 있다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 이미지는 Baba 퍼즐 벤치에서 인간과 여러 LLM의 시간당 누적 해결 과제를 비교한 라인 차트로, 입력된 퍼즐 상태에 대해 모델이 내부 추론과 계획을 통해 행동을 생성하고 시간이 지남에 따라 누적 해결 수가 늘어나는 과정을 시각화하고 있다. 차트 상단에는 Claude Fable 5가 인간보다 동일 과제에 도달하는 속도에서 '4.2x faster'로 표기되어 있어 시간 대비 처리량 측면에서 주목할 만한 차이가 존재함을 보여준다. 여러 모델의 곡선이 서로 다른 기울기를 보인 점은 추론·탐색 전략과 장기 계획 능력의 차이를 반영하며, 단순 성공률 외에 시간과 자원 소비를 함께 고려해야 하는 트레이드오프가 존재함을 시사한다.

섹션별 상세

01
이미지의 주된 관측은 시간 축에 따른 누적 해결 과제 수를 인간과 여러 LLM이 비교한 그래프라는 점이다. 입력은 퍼즐 상태와 규칙이며 모델은 내부 추론과 계획 단계를 통해 다음 행동을 선택해 목표 상태로 수렴한다. 그래프에서 인간과 특정 모델의 곡선이 서로 다른 기울기를 보이며 시간이 지남에 따라 해결 속도 차이를 드러낸다. 이 수치 비교는 모델의 실시간 추론 효율성과 탐색 전략의 차이를 평가하는 근거가 된다.
02
이미지 상단의 주석은 Claude Fable 5와 인간 간에 '4.2x faster'라는 속도 차 주석을 명시하고 있어 특정 모델이 동일한 해결 개수에 도달하는 데 걸리는 시간에서 유의미한 차이를 보였음을 나타낸다. 이 지표는 동일한 테스트 세트에서 누적 과제 수를 기준으로 시간 대비 성과를 산정하는 방식으로 확보되었을 가능성이 크다. 해당 표기는 시간당 처리량과 비용-효율성 관점에서 모델 간 트레이드오프를 암시한다. 따라서 모델 선택 시 단순한 성공률뿐 아니라 시간과 자원 소비를 함께 고려해야 한다는 결론이 도출된다.
03
그래프에는 Claude Fable 5 외에도 여러 최신 모델들이 서로 다른 곡선을 보이며 인간 최적 곡선과 비교되는 구간이 존재한다. 각 모델은 입력으로 퍼즐 상태를 받고 내부 정책·추론 모듈로 행동을 생성하며 반복 시도와 탐색을 통해 누적 해결 수를 증가시킨다. 시각적으로 일부 모델은 초반에 낮은 해결 수에서 완만하게 상승하고 다른 모델은 시간이 지남에 따라 가파른 상승을 보이므로 탐색 전략과 장기 계획 능력에서 차이가 있는 것으로 해석된다. 이 관찰은 퍼즐형 벤치에서 모델의 설계·추론 방식이 성능·속도 균형에 직접적인 영향을 미침을 의미한다.

이미지 분석

시간 축에 따른 누적 해결 과제 수를 나타내는 라인 차트로 인간과 여러 언어 모델의 성과를 비교하고 Claude Fable 5에 '4.2x faster' 주석을 붙였다.
Chart

차트는 가로축을 시간(1분에서 10시간 범위)으로 설정하고 세로축을 해결된 과제 수로 설정해 모델별 누적 성능을 시각화했다. 특정 지점에서는 인간 곡선과 모델 곡선 사이에 속도 차 주석이 있으며 몇몇 모델이 시간이 지남에 따라 인간 곡선을 따라잡거나 근접하는 패턴이 관찰된다. 이 시각 자료는 퍼즐형 벤치에서 시간 대비 처리량과 모델 간 트레이드오프를 수치적으로 비교하는 목적으로 제작된 것으로 판단된다.

시간 축에 따른 누적 해결 과제 수를 나타내는 라인 차트로 인간과 여러 언어 모델의 성과를 비교하고 Claude Fable 5에 '4.2x faster' 주석을 붙였다.

용어 해설

Baba Is You 퍼즐 게임(Baba Is You)
Baba Is You는 규칙을 조작해 퍼즐을 푸는 인디 게임으로, 상태와 규칙의 조합으로 문제 해결 경로가 달라진다. 벤치마킹에서는 고정된 평가 환경에서 에이전트가 주어진 맵을 어떻게 해석하고 규칙을 조합해 목표에 도달하는지로 성능을 측정한다. 게임의 구조적 복잡성 때문에 추론 능력, 계획 능력, 그리고 환경 모델링을 동시에 시험하는 지표로 사용된다.
해결된 과제 수(Tasks Solved)
Tasks Solved는 주어진 시간 동안 에이전트가 성공적으로 완료한 퍼즐·문제의 누적 개수를 의미한다. 입력으로 문제 상태를 받고 내부 추론·계획 과정을 거쳐 목표 상태에 도달하면 카운트가 증가하는 방식으로 측정된다. 시간 축에 따른 누적 그래프는 속도와 효율성, 안정성 차이를 동시에 드러내는 벤치마크 지표로 활용된다.
해결 소요 시간(Time-to-Solve)
Time-to-Solve는 개별 과제나 누적 과제를 해결하는 데 걸리는 실제 경과 시간을 의미하며, 모델의 추론 속도와 탐색 효율을 직접적으로 반영한다. 입력된 퍼즐 상태에서 행동을 선택하고 계획을 실행해 목표에 도달할 때까지의 전체 지연과 반복 시도를 포함한다. 벤치 차트에서는 동일한 과제 수에 도달하기 위한 시간 비교로 모델 간 성능을 평가한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 17.수집 2026. 07. 17.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.