본문으로 건너뛰기

Zork-bench: 텍스트 어드벤처 게임을 활용한 LLM 추론 평가 도구

Zork-bench는 고전 텍스트 어드벤처 게임 Zork를 활용해 LLM의 추론 및 문제 해결 능력을 평가하는 벤치마크 도구이다.

섹션별 상세

Zork는 텍스트 기반의 복잡한 미로 탐험과 퍼즐 해결을 요구하며, 이는 LLM의 논리적 추론과 계획 수립 능력을 테스트하기에 적합한 환경을 제공한다.
실험 결과 대다수 LLM은 350점 만점 중 평균 50점 수준에 머물렀으며, 게임 내 아이템 관리와 같은 복합적인 문제 해결에서 낮은 성능을 보였다.
근거
  • LLM은 350점 만점 중 평균 50점 수준에 머물렀다. 논문 인용 그래프 및 본문 내용
Zork-bench는 게임 내 객체와 사실을 무작위로 변경하는 기능을 포함하여 모델이 학습 데이터의 암기 없이 새로운 상황에서 추론하는지 평가한다.
LLM은 도구 사용 여부에 따라 성능 차이를 보였으며, 컨텍스트 윈도우가 커질수록 토큰 소비가 급격히 증가하는 비효율성이 관찰됐다.
인간 플레이어와의 비교 평가에서 LLM은 초기 단계에서 인간과 유사한 수준의 성과를 보였으나, 장기적인 기억 유지와 컨텍스트 관리 측면에서 한계를 드러냈다.

용어 해설

Z-machine
Infocom이 Zork와 같은 텍스트 어드벤처 게임을 구동하기 위해 개발한 가상 머신 엔진. 게임 로직을 해석하고 실행하는 핵심 환경으로, 현대의 에뮬레이터 기술로 재구현된다.
컨텍스트 윈도우(Context Window)
LLM이 한 번의 추론 과정에서 처리할 수 있는 입력 토큰의 최대 범위. 이 범위를 초과하면 이전 대화나 게임 상태 정보를 유지하지 못해 장기적인 계획 수립과 문제 해결 능력이 저하된다.
텍스트 어드벤처(Text Adventure)
사용자가 텍스트 명령어를 입력하여 가상 세계를 탐험하고 퍼즐을 해결하는 게임 장르. 시각적 요소 없이 오직 텍스트와 상상력에 의존하며, LLM의 논리적 추론 능력을 평가하는 벤치마크 환경으로 활용된다.

기술

  • Zork
  • Z-machine
  • Zulip
  • Docker
  • Anthropic
  • Claude Sonnet
  • DeepSeek
  • Kimi

활용 사례

  • LLM 추론 능력 평가
  • 에이전트 계획 수립 테스트

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 02.수집 2026. 06. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.