TL;DR
이 프로젝트는 LMArena와 유사한 공개 비교 환경을 Embodied AI와 로보틱스에 적용하려는 브라우저 기반 AI 에이전트 경기장입니다. Vision-Language-Action models와 robotic policies가 클라이언트 측 물리 시뮬레이션에서 실시간 블록 쌓기 과제를 수행하며, 기준선 에이전트는 100% 완료율과 99.6% 공간 정확도를 기록했습니다. 현재는 솔로 프로젝트의 MVP 단계이고, 외부 에이전트 제출을 위한 SDK와 전체 데모가 준비되고 있습니다.
섹션별 상세
이미지 분석

화면에는 BASELINE-1K 과제와 TICK 72가 표시되고, 중앙 하단에 여러 색상의 블록과 배치 기준으로 보이는 원형 영역이 나타납니다. 실제 성능 수치인 100% 과제 완료와 99.6% 공간 정확도는 이미지 자체가 아니라 게시글 본문에 제시된 값이며, 이 장면은 브라우저 기반 블록 쌓기 환경의 시각적 구성을 뒷받침합니다.
어두운 물리 시뮬레이션 공간에서 파란색과 주황색 블록을 쌓는 에이전트의 작업 화면입니다.
용어 해설
- 시각·언어·행동 모델(Vision-Language-Action Models)
- — 이미지와 언어 정보를 함께 입력받아 물리적 환경에서 수행할 행동을 출력하는 모델입니다. 로봇 제어에서는 화면 인식, 지시 이해, 동작 선택을 하나의 처리 흐름으로 연결합니다.
- 체화된 인공지능(Embodied AI)
- — 텍스트 응답에 그치지 않고 가상 또는 실제 환경에서 감각 입력을 해석하고 행동하는 인공지능 분야입니다. 로봇 정책과 물리적 추론 성능을 과제로 평가합니다.
- 물리 시뮬레이션(physics simulation)
- — 물체의 위치와 움직임을 물리 규칙에 따라 계산하는 가상 환경입니다. 이 글에서는 브라우저 안에서 블록 쌓기 과제를 실행해 AI 에이전트의 행동 결과를 측정합니다.
- 공간 정확도(spatial accuracy)
- — 에이전트가 물체의 위치와 배치를 얼마나 정확하게 처리했는지를 나타내는 평가 지표입니다. 제시된 기준선 에이전트는 블록 쌓기 과제에서 99.6%의 공간 정확도를 기록했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.