TL;DR
STS2-Bench는 Slay the Spire 2라는 롱호라이즌·불가역적 결정 구조를 활용해 제로샷 LLM의 장기 의사결정 능력과 컨텍스트 내 산술 정확성, 프로토콜 준수력을 동시에 측정하는 벤치마크로 설계되었고 동일 시드·A2 난이도·Ironclad 캐릭터 조건에서 7개 모델을 비교해 총 21회 실행에서 모두 사망으로 종료되었으며 GPT-5.6 Sol이 세 시드에서 가장 일관된 깊이 진입을 기록해 최고 성과를 냈다. 점수는 층수 기반의 기본점수(Ascension 2에서 층당 약 12점)에 보스 승리 보너스(+500)와 일괄 실행 보상/조회 패널티를 더한 형태로 산출되었고 이로 인해 플레이 스킬과 프로토콜 규율이 독립적인 영향력을 가짐이 드러났다. 총 토큰 소모는 약 4억 7천만 토큰, 전체 비용은 약 336달러였고 비용 효율성은 모델별로 크게 달라 Terra가 점수당 비용에서 우수했고 DeepSeek가 최저 비용 베이스라인을 형성했다. 표본 수(각 모델 3시드)와 단일 캐릭터·난이도 제약이 명시된 한계이므로 결과는 경향성으로 해석해야 하며 향후 시드·캐릭터 확장과 스코어 가중치 민감도 분석이 제안되었다.
주요 논점
장기 누적 의사결정을 평가하기 위해 Slay the Spire 2를 환경으로 사용한 접근은 불가역성·확률성·장기 보상 구조를 모두 포함하여 모델의 내적 계획력과 정확한 계산 능력을 동시에 측정할 수 있는 적절한 프록시임이 확인됐다.
스코어링에 포함된 프로토콜 패널티는 행동 일괄화와 상태 조회 빈도를 규율하는 명확한 기준을 제공하지만 가중치 선택이 결과에 민감해 순위 해석시 주의가 필요하다는 점이 존재한다.
샘플 수가 작고 단일 캐릭터·난이도로 제한되어 있어 현재 결과만으로는 일반화가 어렵고, RL 기반 정책이나 도구 허용 시 성능이 크게 달라질 가능성이 있어 추가 통제가 필요하다.
합의점 vs 논쟁점
합의점
- 장기 누적 의사결정과 컨텍스트 내 정확한 계산 능력이 LLM의 현실적 에이전트 역량을 평가하는 데 핵심 지표라는 점
- 스코어링 가중치와 프로토콜 규칙이 리더보드에 큰 영향을 미치므로 가중치 설계는 결과 해석에 결정적이라는 점
- 샘플 수 확대·다양한 시드와 캐릭터 사용이 후속 연구에서 필수적이라는 점
논쟁점
- get_view 호출당 −100과 같은 큰 패널티가 합리적인지 여부와 그로 인해 프로토콜 우선 전략이 실제 목표(완주)보다 유리하게 되는지
- 도구·외부 메모리·재학습을 완전히 배제한 설계가 일반적 에이전트 역량을 과도히 낮게 측정하는지 여부
실용적 조언
- 평가는 각 모델당 최소 10개 이상의 시드를 사용해 중앙값과 분포를 기반으로 결과를 제시해야 신뢰도를 확보할 수 있다.
- 스코어 가중치 민감도를 점검하기 위해 get_view와 단일 액션/다중 액션 페널티를 축마다 변화시켜 리더보드의 견고성을 측정해야 한다.
- 비용 효율성 평가를 위해 각 모델의 토큰 소비량과 달러 대비 점수 비율을 표준화하고, 인프라 재시도 비용을 분리해 순수 플레이 비용을 산출해야 한다.
섹션별 상세
이미지 분석

이미지는 모델별 단일 실행 점수의 분산을 시각화하여 특정 모델이 단일 행운에 의해 상위에 오른 것이 아니라 재현 가능한 깊이 진입으로 우위를 점했는지를 판별할 수 있게 한다. 그래프에서 GPT-5.6 Sol은 세 시드에서 모두 높은 층수와 일관된 점수를 기록해 교차시드 분산이 작았음을 확인할 수 있다.
리더보드의 모델별 점수 분포와 세드별 성과 편차를 보여주는 산점도.

이미지는 모든 시드에서 Act 1 보스가 배치된 Floor 17에서 사망이 집중되었음을 시각적으로 입증하며, 이 지점이 구조적 난이도 상승 구간으로서 선택의 누적 효과를 평가하는 핵심 관문임을 드러낸다. 따라서 층수 도달 분포는 단순 난수 변동이 아니라 게임 레벨 설계와 직접 연결되어 있다.
Floor 17에 사망이 집중된 원인을 시각적으로 보여주는 게임 구조 관련 차트.
용어 해설
- 장기 계획수립(Long-horizon Planning)
- — 여러 단계에 걸쳐 결과가 누적되는 환경에서 초기 선택이 후속 성과에 미치는 영향을 평가하는 개념으로서, 이 벤치마크에서는 덱 구성·루트 선택·리스크 관리가 장기 승패에 어떻게 연결되는지를 측정하는 핵심 기준으로 사용된다.
- 콘텍스트 내 계산(In-context Calculation)
- — 모델이 외부 계산 도구 없이 입력된 텍스트 컨텍스트 내부에서 연속적인 산술·확률·상태 추적 계산을 수행하는 능력으로서, 이 평가에서는 피해·블록·에너지 배분 등 모든 산술을 모델의 추론 체인 내부에서 정확히 처리해야 한다.
- 행동 일괄 제출(Action Batching)
- — 여러 액션을 하나의 호출로 묶어 실행 요청함으로써 상태 읽기 횟수를 줄이고 계획을 내부에서 완성하는 방식으로서, 점수 보정 항목은 일괄 제출을 장려하기 위해 다중 액션 제출에 보상을 부여하고 단일 액션 제출에는 패널티를 부과한다.
코드 예제
base = floor reached × 10 × (1 + Ascension level / 10)총점 산출의 기초가 되는 수식으로서 각 층(floor)에 부여되는 기본 점수를 Ascension 레벨로 조정하는 방식의 예시다.
언급된 도구
벤치마크 환경으로 사용된 록라이크 덱빌딩 게임
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.