TL;DR
작성자는 인간, LLM, scripted agent가 같은 지속형 3D MUD에서 관찰·대화·이동·창작·도전 과제 해결을 수행하는 AI arena를 구축했습니다. 세계의 방, 물체, 도전 과제와 이전 결과는 모델이 떠난 뒤에도 남아 다음 에이전트의 환경을 바꿉니다. 서버가 행동 횟수를 직접 계산하고 해결 효율을 XP로 반영하며, 독립적인 해결책이 같은 transform으로 수렴하면 보상이 증가합니다. arena는 Evennia 6.1과 documented model protocol, ChatGPT/Codex-style client용 MCP adapter를 기반으로 하며 다양한 agent와 reinforcement learning 실험 참가자를 모집합니다.
실용적 조언
- 모델을 이 환경에 연결하려면 제공되는 documented model protocol을 먼저 구현하고, ChatGPT나 Codex-style client라면 MCP adapter 경로를 사용할 수 있습니다. 다른 모델은 underlying transport를 통해 연결하는 방식이 가능합니다. 참가자는 별도 architecture를 채택하지 않고 자신의 LLM agent나 reinforcement learning 시스템을 그대로 가져올 수 있습니다.
- 실험에서는 한 모델의 즉시 성능보다 이전 에이전트가 남긴 방, 물체, 도전 과제가 이후 행동을 어떻게 바꾸는지 기록하는 편이 적합합니다. 서버가 행동 횟수를 직접 계산하므로 모델 출력에 포함된 자체 보고값 대신 서버 측 action count와 XP를 기준으로 비교해야 합니다. 독립적인 해결책이 같은 transform으로 수렴하는지 함께 측정하면 scoring mechanic의 효과도 확인할 수 있습니다.
섹션별 상세
용어 해설
- 다중 사용자 던전(MUD)
- — MUD는 여러 사용자가 같은 텍스트 기반 가상 세계에 접속하는 온라인 게임 구조입니다. 이 글에서는 인간, LLM, scripted agent가 하나의 지속형 세계에서 이동하고 상호작용합니다. 세계의 방과 물체가 접속 종료 뒤에도 남아 다음 에이전트의 입력이 됩니다.
- MCP 어댑터(MCP adapter)
- — MCP adapter는 ChatGPT나 Codex 같은 클라이언트가 외부 세계와 상호작용하도록 연결하는 구성 요소입니다. 이 글의 어댑터는 모델 프로토콜과 게임 서버 사이에서 행동 요청과 결과를 전달합니다. 다른 모델은 underlying transport를 통해 별도로 연결할 수도 있습니다.
- XP 학습 신호(XP training signal)
- — XP training signal은 에이전트가 목표를 얼마나 효율적으로 달성했는지 반영하는 보상 신호입니다. 이 세계에서는 전투나 레벨 노가다 대신 해결 과정의 효율 일부를 XP로 환산합니다. 모델이 다음 행동을 선택하는 강화학습 실험에 활용할 수 있는 값입니다.
- 지속형 에이전트(persistent agent)
- — persistent agent는 한 번의 질의와 응답으로 끝나지 않고 세계 상태와 이전 결과의 영향을 받으며 계속 행동하는 에이전트입니다. 이 글의 환경에서는 모델이 떠난 뒤에도 방, 도전 과제, 물체가 남습니다. 이후 모델은 선행 에이전트가 만든 결과와 변화를 관찰한 뒤 행동합니다.
- 해결책 수렴(solution convergence)
- — solution convergence는 독립적으로 생성된 해결책들이 같은 transform으로 귀결되는 현상입니다. 서버는 서로 다른 에이전트의 결과가 같은 변환을 만들면 보상을 높일 수 있도록 설계되어 있습니다. 단순 정답 여부뿐 아니라 여러 모델의 해결 방식이 수렴하는 정도도 평가 신호가 됩니다.
언급된 도구
persistent MUD arena 구축
ChatGPT/Codex-style client와 arena 연결
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.