본문으로 건너뛰기

Secret Hitler Bench: LLM의 사회적 추론 및 기만 능력을 평가하는 벤치마크

8인용 보드게임 'Secret Hitler'를 통해 LLM의 거짓말, 기만, 동맹 형성 및 사회적 추론 능력을 평가하는 오픈소스 벤치마크 프레임워크이다.

섹션별 상세

기존의 단순 질의응답 벤치마크와 달리, 8인용 사회적 추론 게임인 'Secret Hitler' 규칙을 완전히 구현하여 모델의 고차원적 상호작용 능력을 평가한다. 에이전트는 조사, 특별 선거, 처형 등 게임 내 권한을 행사하며 동맹을 맺거나 적을 기만해야 한다. OpenRouter를 통해 GPT-4, Claude 3.5, Gemini 등 다양한 최신 모델을 팀별로 배치하여 대결시킴으로써 모델 간의 전략적 우위와 사회적 지능 차이를 비교할 수 있는 환경을 제공한다.
bash
python main.py --model google/gemini-2.5-flash --stream

Gemini 2.5 Flash 모델을 사용하여 실시간으로 게임을 실행하는 명령어이다.

에이전트들에게 단순한 역할 부여를 넘어, 2년간 매주 게임을 즐겨온 '친구 그룹'이라는 구체적인 페르소나와 관계망을 설정하여 현실적인 사회적 역학 관계를 시뮬레이션한다. 각 캐릭터는 직업, 성격, 연인 또는 룸메이트 관계 등의 배경지식을 가지고 있어, 특정 인물을 본능적으로 방어하거나 침묵의 의미를 해석하는 등 유기적인 대화가 발생한다. 이러한 설정은 순수한 게임 이론적 접근을 넘어 LLM이 복잡한 인간 관계 맥락을 얼마나 잘 이해하고 활용하는지 테스트하는 핵심 요소이다.
모델의 전략적 사고를 분석하기 위해 공개 대화와 분리된 '내적 독백' 시스템을 도입하여 에이전트가 겉으로 내뱉는 말 뒤에 숨겨진 실제 의도 데이터를 산출한다. 관찰자는 실시간 웹 UI를 통해 에이전트가 어떤 근거로 거짓말을 계획하거나 누구를 의심하고 있는지 확인이 가능하며, 이는 모델의 정렬 및 기만적 성향 연구에 중요한 데이터를 제공한다. 모든 게임 로그는 JSONL 형식으로 저장되어 사후 분석 및 모델 성능 통계 산출에 활용된다.
bash
python server.py --port 5050

게임 진행 상황을 시각적으로 확인할 수 있는 웹 UI 서버를 실행하는 명령어이다.

Secret Hitler Bench의 실시간 웹 인터페이스 스크린샷이다.
Screenshot8명의 플레이어 상태, 자유주의 및 파시스트 정책 보드, 실시간 대화 피드 및 각 모델의 내적 독백(Inner Thoughts)을 시각적으로 나타낸다. 이를 통해 사용자는 AI 에이전트 간의 상호작용과 전략적 추론 과정을 한눈에 파악할 수 있다.

용어 해설

사회적 추론(Social Deduction)
플레이어들이 서로의 숨겨진 정체를 밝혀내거나 기만하는 보드게임 장르로, 논리적 추론과 심리전이 핵심이다. 이 아티클에서는 LLM이 이러한 복잡한 심리전을 수행할 수 있는지 평가하는 지표로 활용된다.
내적 독백(Inner Monologue)
모델이 외부로 출력하기 전 내부적으로 수행하는 비공개 추론 과정이다. 이를 통해 모델이 겉으로 드러내는 말과 실제 의도 사이의 차이를 분석하여 기만 전략의 수립 과정을 파악할 수 있다.
오픈라우터(OpenRouter)
다양한 대형 언어 모델 제공업체의 API를 하나의 통합된 인터페이스로 제공하는 게이트웨이 서비스이다. 단일 API 키로 200개 이상의 최신 모델에 접근하여 벤치마크 테스트를 수행할 수 있게 한다.
도구 호출(Tool Calling)
모델이 외부 함수나 API를 실행할 수 있도록 구조화된 출력을 생성하는 기능이다. 게임 내에서 조사, 선거, 처형 등의 액션을 수행하기 위해 모델이 반드시 지원해야 하는 핵심 기술이다.

기술

  • OpenRouter
  • Python
  • Gemini 2.5 Flash
  • Claude Sonnet 4.6
  • GPT-4.1

활용 사례

  • LLM 벤치마킹
  • 사회적 지능 평가
  • 기만적 성향 연구
  • 멀티 에이전트 시뮬레이션
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 24.수집 2026. 03. 24.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.