본문으로 건너뛰기

STICKBLADE-ARENA: 2D 물리 엔진 기반의 LLM 추론 평가 프레임워크

2D 물리 엔진을 활용해 LLM의 추론 능력을 실시간 격투로 평가하고 인간의 블라인드 투표로 Elo 점수를 산출하는 프레임워크.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

STICKBLADE-ARENA는 pymunk 물리 엔진을 활용해 LLM이 제어하는 스틱맨 간의 2D 격투를 구현한 새로운 추론 평가 프레임워크이다. 모델은 매 턴 JSON 상태 정보를 바탕으로 행동을 결정하며, 인간의 블라인드 투표를 통해 모델, 무기, 환경 등 6개 축으로 세분화된 Elo 점수를 산출한다. 기존 LLM-as-a-judge 방식의 편향을 배제하고 실전 추론 능력을 측정하며, deepseek-r1-distill-70b의 타임아웃 문제나 스크립트 봇의 경쟁력과 같은 실제 성능 데이터를 제공한다. 현재 더 정밀한 평가를 위해 커뮤니티의 투표 참여를 요청하고 있다.

실용적 조언

  • LLM의 추론 능력을 평가할 때 LLM-as-a-judge 방식의 편향을 피하기 위해 인간의 블라인드 투표를 도입할 것.
  • 모델의 성능을 다각도로 검증하기 위해 무기, 모드 등 다양한 변수를 포함한 다차원 Elo 점수를 활용할 것.

섹션별 상세

01
STICKBLADE-ARENA는 pymunk 물리 엔진을 사용하여 LLM이 제어하는 스틱맨 캐릭터 간의 2D 격투를 구현했다.
02
모델은 매 턴마다 HP, 위치, 무기 사거리 등 JSON 상태 정보를 입력받아 행동을 결정하며, 이는 단순 프롬프트가 아닌 실제 추론 능력을 요구한다.
03
평가는 LLM-as-a-judge 방식의 편향을 피하기 위해 인간이 승자를 직접 투표하는 블라인드 테스트 방식을 채택했다.
04
Elo 점수는 모델, 무기, 모드 등 6개 축으로 세분화되어, 특정 상황에서의 추론 능력을 정밀하게 측정한다.
05
deepseek-r1-distill-70b는 과도한 사고로 인한 타임아웃 문제가 발생하며, 일부 스크립트 기반 봇이 하위권 LLM보다 우수한 성능을 보인다.

용어 해설

Elo 점수(Elo Rating)
승패 결과를 바탕으로 상대적 실력을 정량화하는 평점 시스템이다. 본문에서는 모델의 무기, 모드 등 6개 축에 따라 개별 점수를 산출하여 정밀한 비교를 수행한다.
Pymunk
2D 물리 엔진 라이브러리로, 스틱맨의 모멘텀과 물리적 충돌을 구현하여 LLM의 추론 환경을 조성한다.
추론 모델(Reasoning Model)
단순 텍스트 생성을 넘어 상황을 판단하고 전략을 수립하는 능력을 갖춘 모델이다. 본문에서는 격투 상황에서 무기 사용과 거리 조절을 판단하는 능력을 평가한다.

언급된 도구

pymunk추천

2D 물리 엔진

OpenRouter중립

모델 호스팅

Groq중립

모델 호스팅

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 29.수집 2026. 08. 29.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.