TL;DR
작성자는 LLM 벤치마크 점수가 실제 사용감과 다르다는 문제의식에서 WorldBuild Bench를 구축해 동일한 세 개의 약 30라인 게임 프롬프트로 9개 모델이 만든 브라우저 재생 가능 게임 27개를 생성했다. 생성 파이프라인은 오픈소스 하네스와 Three.js, Rapier, Playwright를 결합해 모델 출력을 3D 씬과 물리 시뮬레이션으로 변환했고 주요 평가는 블라인드 페어와이즈 비교를 통해 게임의 체감과 세계 설계, 표현, 완성도, 전반적 품질을 인간 판단으로 수집하는 방식으로 진행되었다. 결과와 메타데이터로서 프롬프트, 생성물, 생성 시간, 추정 비용, 코드 크기를 공개했으며 보고된 비용 수치로는 Fable이 세 번 실행에 약 756달러, GPT-5.6 Sol이 약 108달러, GLM-5.2와 Grok 4.5가 각각 약 19달러였고 작성자는 표본이 작고 주관적 요소가 개입함을 인정하면서 방법론 확장과 반복 실행을 통해 검증을 이어갈 계획이라고 밝혔다.
섹션별 상세
용어 해설
- Three.js
- — 브라우저에서 WebGL을 통해 3D 그래픽을 렌더링하는 JavaScript 라이브러리로, 본문에서는 LLM이 생성한 게임 씬을 브라우저에서 시각화하고 상호작용 가능하게 만드는 렌더링 계층으로 사용되었다.
- Rapier
- — 경량 물리 시뮬레이션 엔진으로 충돌 처리와 동역학 계산을 제공하여 에이전트가 만든 오브젝트 간 물리적 상호작용과 시간 경과에 따른 일관성을 재현하는 데 쓰였다.
- Playwright
- — 브라우저 자동화 도구로 테스트 및 자동 상호작용을 위해 사용되며 본 실험에서는 생성된 게임을 자동으로 실행하고 녹화하거나 평가 인터페이스로 연결하는 데 활용되었다.
- Blind Pairwise Comparison
- — 평가자가 모델 이름을 모른 채 동일한 브리프에서 생성된 두 결과물을 나란히 비교하여 선호를 선택하는 방법으로, 자동화된 수치화가 어려운 체감 품질을 인간 판단으로 수집하는 데 사용되었다.
기술
- Three.js
- Rapier
- Playwright
- 오픈소스 하네스
활용 사례
- LLM의 공간·시간·인과 일관성 평가
- 브라우저 재생 가능한 게임 생성 성능 비교
- 비용 대비 생성 품질 분석
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.