본문으로 건너뛰기

WorldBuild Bench 구축과 초기 비교 실험

WorldBuild Bench는 동일한 30줄 내외 게임 프롬프트로 9개 모델이 생성한 브라우저용 3D 게임 27개를 블라인드 비교해 공간·시간·인과 일관성과 비용을 함께 평가했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 LLM 벤치마크 점수가 실제 사용감과 다르다는 문제의식에서 WorldBuild Bench를 구축해 동일한 세 개의 약 30라인 게임 프롬프트로 9개 모델이 만든 브라우저 재생 가능 게임 27개를 생성했다. 생성 파이프라인은 오픈소스 하네스와 Three.js, Rapier, Playwright를 결합해 모델 출력을 3D 씬과 물리 시뮬레이션으로 변환했고 주요 평가는 블라인드 페어와이즈 비교를 통해 게임의 체감과 세계 설계, 표현, 완성도, 전반적 품질을 인간 판단으로 수집하는 방식으로 진행되었다. 결과와 메타데이터로서 프롬프트, 생성물, 생성 시간, 추정 비용, 코드 크기를 공개했으며 보고된 비용 수치로는 Fable이 세 번 실행에 약 756달러, GPT-5.6 Sol이 약 108달러, GLM-5.2와 Grok 4.5가 각각 약 19달러였고 작성자는 표본이 작고 주관적 요소가 개입함을 인정하면서 방법론 확장과 반복 실행을 통해 검증을 이어갈 계획이라고 밝혔다.

섹션별 상세

01
LLM 표준 벤치마크 점수가 실제 사용감과 다를 수 있다는 문제의식에서 출발하여 작성자는 재현 가능한 방식으로 공간적·시간적·인과적 일관성을 측정하려는 목적을 세웠고 이를 위해 동일한 세 개의 약 30라인 게임 프롬프트를 준비했다. 입력으로는 한 브리프와 모델 출력 텍스트가 주어지고 오픈소스 하네스가 해당 출력을 Three.js로 렌더링하고 Rapier로 물리 시뮬레이션하며 Playwright로 브라우저 재생을 자동화하는 처리 파이프라인을 구성했다. 첫 실행에서 9개 모델이 각 브리프를 처리해 총 27개의 브라우저 재생 가능 게임을 생성했고 이 결과를 통해 벤치마크 점수가 놓치기 쉬운 체감적 품질을 비교하려는 설계 의도를 실현했다.
02
모델의 세계 이해 능력과 일관성을 정량화하기 어려워서 주된 평가는 블라인드 페어와이즈 비교를 통해 인간 선호를 수집하는 방식으로 진행되었다. 평가 참여자는 같은 브리프에서 나온 두 게임을 모델 이름을 모른 채 플레이한 뒤 게임의 체감, 세계 설계, 표현, 완성도, 전반적 품질을 서로 비교하는 절차에 따라 결과를 입력했고 이 과정에서 프롬프트 원문, 생성 산출물, 생성 시간, 추정 비용, 코드 크기를 함께 공개해 결과의 재현성과 검증 가능성을 확보하려 했다. 자동 채점으로 잡기 어려운 공간·시간·인과적 오류를 인간 검토로 보완함으로써 단순 벤치 점수보다 실사용 관점의 성능 차이를 드러내려는 평가 목적이 명확해졌다.
03
초기 실행 결과로 비용과 품질 간 눈에 띄는 차별이 관찰되었고 몇몇 모델의 경우 높은 비용이 상대적으로 우수한 체감을 제공했으나 표본이 작고 주관적 편향이 개입한다고 작성자가 명시했다. 보고된 원문 수치로는 Fable의 세 번 실행 비용이 약 756달러였고 GPT-5.6 Sol은 약 108달러, GLM-5.2와 Grok 4.5는 각각 약 19달러였으며 작성자는 Fable이 강한 결과를 낸 반면 Opus는 비용 차이를 고려하면 예상보다 Fable에 근접한 품질을 보였고 Kimi는 비용이 GPT 수준에 근접하면서 Opus와 비슷한 체감을 보였다고 의견을 덧붙였다. 이 관찰은 비용 대비 생성 품질의 트레이드오프를 실험적으로 드러내며 표본 확대와 방법론 정교화가 다음 단계임을 시사한다.

용어 해설

Three.js
브라우저에서 WebGL을 통해 3D 그래픽을 렌더링하는 JavaScript 라이브러리로, 본문에서는 LLM이 생성한 게임 씬을 브라우저에서 시각화하고 상호작용 가능하게 만드는 렌더링 계층으로 사용되었다.
Rapier 물리엔진(Rapier)
경량 물리 시뮬레이션 엔진으로 충돌 처리와 동역학 계산을 제공하여 에이전트가 만든 오브젝트 간 물리적 상호작용과 시간 경과에 따른 일관성을 재현하는 데 쓰였다.
Playwright
브라우저 자동화 도구로 테스트 및 자동 상호작용을 위해 사용되며 본 실험에서는 생성된 게임을 자동으로 실행하고 녹화하거나 평가 인터페이스로 연결하는 데 활용되었다.
블라인드 쌍비교(Blind Pairwise Comparison)
평가자가 모델 이름을 모른 채 동일한 브리프에서 생성된 두 결과물을 나란히 비교하여 선호를 선택하는 방법으로, 자동화된 수치화가 어려운 체감 품질을 인간 판단으로 수집하는 데 사용되었다.

기술

  • Three.js
  • Rapier
  • Playwright
  • 오픈소스 하네스

활용 사례

  • LLM의 공간·시간·인과 일관성 평가
  • 브라우저 재생 가능한 게임 생성 성능 비교
  • 비용 대비 생성 품질 분석

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 22.수집 2026. 07. 22.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.