본문으로 건너뛰기

MIRA 공개: General Intuition·Kyutai·Epic Games 협업 게임 에이전트 발표

MIRA는 10k 시간 합성 Rocket League 플레이로 학습된 5B 파라미터 게임 에이전트로, 단일 B200에서 4인 동시 플레이를 초당 20프레임으로 실행하며 데모·기술보고서·1k 시간 데이터셋을 공개했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

MIRA는 General Intuition, Kyutai, Epic Games의 협력으로 공개된 게임 에이전트로서 10k 시간의 합성 Rocket League 플레이 데이터로 학습된 5B 파라미터 모델이며 단일 B200에서 4인 동시 플레이를 초당 20프레임으로 구동한 성능 수치가 제시되었다. 데모와 기술보고서, GitHub 저장소, 그리고 1k 시간 분량의 4인 플레이 데이터셋이 함께 공개되어 결과 재현과 추가 실험 경로를 제공한다. ICML 현장 데모를 통해 직접 상호작용할 수 있는 기회를 마련해 실사용 환경에서의 체감 성능 확인이 가능하도록 구성되어 있으며 세부적 아키텍처와 학습 하이퍼파라미터는 기술보고서에서 확인해야 정확한 비교와 한계 평가가 가능하다.

실용적 조언

  • 공개된 기술보고서와 GitHub 저장소를 우선 확인해 모델 아키텍처와 데이터 전처리·학습 파이프라인을 재현한 뒤 동일한 B200 환경에서 런타임 성능을 비교 측정할 것을 권장한다.

섹션별 상세

01
MIRA의 학습 데이터 구성은 합성 Rocket League 플레이로그에 기반하며 총 10k 시간 분량의 시뮬레이션 데이터를 사용한 것으로 명시되어 있다. 학습 과정은 대규모 시뮬레이션으로부터 관찰-행동 쌍을 수집해 모델이 게임 상태를 입력으로 받아 플레이어 행동을 출력하도록 정책을 학습한 방식으로 유추된다. 게시물은 별도로 1k 시간 분량의 4인 플레이 데이터셋을 공개했다고 밝히며 데이터 규모와 공개 여부를 근거로 제시하고 있다. 합성 데이터 사용은 현실 데이터 부족을 보완하고 재현 가능한 실험 기반을 제공하므로 후속 연구와 비교 검증이 용이하다는 의미가 있다.
02
모델 크기와 런타임 성능이 핵심 성과로 제시되어 있으며 모델은 5B 파라미터이고 단일 B200에서 4인 동시 플레이를 초당 20프레임으로 구동한다고 명시되어 있다. 이 수치는 모델이 실시간 또는 준실시간 멀티에이전트 환경에서 동작할 수 있음을 시사하며 하드웨어 자원과 프레임 속도 간 균형을 통해 실사용 가능성을 평가할 수 있게 한다. 런타임 성능 수치는 게시물이 제공한 구체적 수치로 근거가 명확하고, 동일한 하드웨어 구성으로 다른 연구자들이 재현 테스트를 할 수 있는 비교점이 된다. 따라서 이 결과는 멀티에이전트 게임 에이전트의 추론 효율과 배포 가능성을 판단하는 데 실질적 근거를 제공한다.
03
공개 자료와 접근성 측면에서는 온라인 데모, 기술보고서, GitHub 저장소, 그리고 ICML 현장 시연이 모두 제공되어 연구자와 개발자가 결과를 검증하고 직접 체험할 수 있도록 구성되어 있다. 온라인 데모 링크와 기술보고서 URL, 저장소 URL이 게시물에 포함되어 있어 코드·데이터·문서를 통해 재현성과 추가 실험이 가능하다는 점이 근거로 제시되어 있다. ICML 부스에서 PlayStation 컨트롤러로 직접 플레이할 수 있다는 안내는 실시간 인터랙션을 통한 질적 검증 경로를 추가로 제공한다. 이와 같은 공개 정책은 연구 투명성과 커뮤니티 참여를 높여 후속 비교 연구와 응용 개발을 촉진할 가능성이 있다.

용어 해설

합성 데이터(Synthetic Data)
합성 데이터는 실제 환경을 모사한 시뮬레이션에서 생성된 데이터로, 본문에서는 Rocket League 시뮬레이터로 생성한 플레이 로그를 의미한다. 입력 상태와 행동을 대량으로 만들 수 있어 데이터 부족이나 레이블링 비용 문제를 회피할 수 있다. 시뮬레이션 기반 학습에서 정책을 안정적으로 학습시키고 재현성을 확보하는 데 중요하다.
시뮬레이션 기반 학습(Simulation-based Training)
시뮬레이션 기반 학습은 실제 환경 대신 시뮬레이터에서 에이전트를 동작시켜 관찰과 행동 데이터를 수집하고 정책을 학습시키는 방법론이다. 본문에서는 Rocket League 시뮬레이터로 10k 시간 분량의 플레이를 생성하여 모델 학습에 사용한 것이 이에 해당한다. 현실-시뮬레이션 갭을 관리하면서 대규모 데이터 확보가 가능한 점이 장점이다.
추론 처리량(Inference Throughput)
추론 처리량은 주어진 하드웨어에서 모델이 단위 시간당 처리할 수 있는 입력·출력 작업량을 뜻한다. 본문에서는 단일 B200에서 4인 동시 플레이를 초당 20프레임으로 구동한 수치가 추론 처리량의 실사용 지표로 제시되었다. 멀티에이전트 실시간 제어에서 처리량과 지연이 시스템 성능을 결정한다.

언급된 도구

B200중립

모델 추론용 하드웨어

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 07.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.