본문으로 건너뛰기

이전 프로젝트 게시글 이후 피드백을 반영한 빠른 업데이트

VSArena가 VLA 정책 입력과 상태 기반 평가를 분리하고 서버 측 ELO 하니스를 준비 중입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

VSArena는 이전 피드백을 반영해 정책 입력이 카메라 영상과 언어 지시로 제한되는 VLA 트랙과 실제 pose를 제공하는 state-based 트랙을 분리했습니다. VLA 정책에는 128×128 RGB 카메라와 큐브 쌓기 지시만 들어가며, 실제 큐브 pose는 spatial accuracy와 task completion을 계산하는 채점기에만 전달됩니다. 브라우저의 Studio는 Rapier/WASM 기반 클라이언트 측 데모로 공개 ELO에 참여하지 않고, 공개 점수는 서버 측 호스팅 하니스에서만 산출하도록 설계했습니다. 저장소와 scoring·SDK 문서는 공개됐지만 호스팅 하니스가 아직 준비되지 않아 외부 제출과 공개 리더보드는 시작되지 않았습니다.

섹션별 상세

01
VSArena는 이전 피드백을 반영해 관측 공간을 VLA 트랙과 state-based 트랙으로 분리했습니다. VLA 정책에는 128×128 RGB 카메라와 큐브 쌓기 언어 지시만 입력되고, 큐브의 pose는 전달되지 않습니다. 채점기는 spatial accuracy와 task completion을 계산할 때 실제 pose를 사용하지만, 이 정보는 정책이 볼 수 없는 judge-only 데이터로 남아 시각-언어 정책과 특권 상태 정책의 비교 조건을 구분합니다.
02
브라우저에서 실행되는 Studio와 공개 순위 산출 경로도 분리했습니다. Studio는 Rapier/WASM을 사용하는 클라이언트 측 60fps 데모이며, 개발·관찰 용도로만 표시되고 공개 리더보드에 점수를 게시하지 않습니다. 공개 ELO는 서버 측에서 실행되는 호스팅 하니스의 결과만 사용하므로 클라이언트 물리 계산을 신뢰해야 하는 문제를 피하려는 구조입니다.
03
프로젝트는 저장소와 평가 문서를 공개했지만 제출을 실제로 받을 호스팅 하니스는 아직 준비 중입니다. 공개된 문서에는 spatial accuracy와 task completion을 이용한 채점 방식, 제출 프로토콜, 관련 코드와 설명이 포함되어 있습니다. 따라서 현재는 VLA와 state 트랙의 설계와 실행 환경을 검토할 수 있지만, 외부 사용자가 서버 평가를 거쳐 공개 ELO를 얻는 단계까지는 도달하지 않았습니다.

이미지 분석

VSArena Studio에서 로봇 팔이 테이블 위의 색상 큐브를 조작하는 3D 시뮬레이션 화면입니다.
Screenshot

이미지는 브라우저 기반 Studio의 3D 환경과 로봇 팔, 큐브, 좌측 상태 패널 및 하단 실행 모드를 함께 담고 있습니다. 본문에서 설명한 Studio가 정책 제출용 공개 평가가 아니라 시뮬레이션을 관찰하고 개발하는 클라이언트 측 환경이라는 점을 시각적으로 뒷받침합니다.

VSArena Studio에서 로봇 팔이 테이블 위의 색상 큐브를 조작하는 3D 시뮬레이션 화면입니다.

용어 해설

시각-언어-행동 모델(VLA)
이미지와 자연어 지시를 입력으로 받아 로봇이나 시뮬레이션 환경의 행동을 출력하는 모델 구조입니다. 이 글에서는 128×128 RGB 카메라 영상과 큐브를 쌓으라는 언어 지시만 정책에 입력하고, 큐브의 실제 위치는 평가 과정에서만 사용합니다.
관측 공간(Observation Space)
정책이 행동을 결정할 때 접근할 수 있는 입력 정보의 범위입니다. VSArena는 카메라 영상과 언어 지시만 받는 VLA 트랙을 별도로 구성해, 큐브의 정확한 위치 정보가 정책에 노출되지 않도록 관측 공간을 제한합니다.
특권 상태 정보(Privileged Poses)
일반 정책에는 제공하지 않지만 디버깅이나 기준 평가에 사용할 수 있는 완전한 상태 정보입니다. VSArena의 state-based 트랙은 큐브의 실제 pose를 정책에 제공하며, VLA 트랙과 구분된 별도 디버그 경로로 운영됩니다.
호스팅 평가 하니스(Hosted Harness)
사용자 제출물을 서버 측에서 동일한 환경으로 실행하고 결과를 채점하는 평가 실행기입니다. VSArena는 브라우저의 클라이언트 측 시뮬레이션과 공개 ELO를 분리하고, 호스팅 하니스에서 산출한 점수만 공개 제출에 사용하려고 합니다.
ELO 점수(ELO)
모델이나 에이전트의 상대적 성능을 비교하기 위해 경기 결과를 누적하는 점수 체계입니다. VSArena에서는 서버 측 호스팅 하니스가 공개 제출을 채점한 뒤 ELO를 산출하며, privileged state 트랙과 Studio 실행 결과는 공개 ELO에 반영하지 않습니다.

언급된 도구

Rapier중립

Studio에서 클라이언트 측 물리 시뮬레이션을 실행하는 라이브러리입니다.

WASM중립

브라우저 기반 Studio에서 시뮬레이션 실행을 지원하는 실행 형식입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 23.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.