섹션별 상세
Neuralink의 임상 시험에서 사용되는 Webgrid 게임 환경을 LLM 벤치마크로 재구축했다. 모델은 30x30 격자판의 스크린샷을 입력받아 파란색 타겟 셀의 위치를 파악하고, screen, mouse_move, mouse_click 세 가지 도구를 조합하여 커서를 이동시키고 클릭을 수행한다.

성능 측정 지표로 초당 비트 수(BPS)를 채택하여 제어의 정밀도와 속도를 동시에 평가한다. BPS는 분당 순 정답 클릭 수(NTPM)와 격자 크기를 변수로 하는 로그 함수를 통해 산출되며, 이는 Neuralink의 공식 평가 로직과 완벽히 일치하도록 설계됐다.
javascript
function E(f, t) {
return Math.max(Math.log2(t * t - 1) * f / 60, 0)
}Neuralink Webgrid 프론트엔드에서 사용되는 BPS 계산 공식 구현체
Claude 4.6 Opus는 Computer Use 기능을 통해 평균 0.80 BPS(최고 1.14 BPS)를 기록하며 현재 테스트된 모델 중 가장 우수한 성능을 보였다. 반면 Gemini 3 Flash Preview는 약 0.16 BPS에 머물러 모델 간 시각적 정밀도와 도구 활용 능력의 격차가 큼이 확인됐다.
인간 및 뇌 임플란트 사용자와의 성능 비교 데이터가 포함됐다. 인간 마우스 사용자는 17.1 BPS, Neuralink 뇌 임플란트(P8) 사용자는 10.39 BPS를 기록한 반면, 최상위 LLM인 Claude 4.6 Opus도 인간 성능의 10% 미만 수준에 머물러 실시간 정밀 제어 분야의 한계를 드러냈다.
bash
make play # 브라우저에서 게임 실행
make eval ARGS="configs/openrouter.yaml" # API 기반 평가 실행벤치마크 실행 및 평가를 위한 주요 CLI 명령어
사용자는 YAML 설정 파일을 통해 격자 크기(grid_size), 캔버스 크기(canvas_size), 평가 시간 등을 자유롭게 구성할 수 있다. OpenRouter, Google AI API뿐만 아니라 Ollama 등을 통한 로컬 LLM 서버와의 연동도 지원하여 다양한 환경에서 테스트가 가능하다.
용어 해설
- 초당 비트 수(BPS)
- — 정보 전송 속도를 나타내는 단위로, 이 벤치마크에서는 커서 제어의 정확도와 속도를 결합하여 사용자의 제어 능력을 수치화한 핵심 지표이다.
- 도구 사용(Tool Use)
- — LLM이 외부 함수나 API를 호출하여 특정 작업을 수행하는 기능으로, 본 아티클에서는 마우스 이동 및 클릭 도구를 조작하는 능력을 의미한다.
- 분당 순 정답 클릭 수(NTPM)
- — 정답 클릭 수에서 오답 클릭 수를 뺀 값으로, 모델이 얼마나 정확하고 빠르게 목표를 달성했는지 측정하는 중간 지표이다.
- 시각 언어 모델(VLM)
- — 이미지(스크린샷)를 입력받아 그 내용을 이해하고 텍스트나 도구 호출 명령을 생성할 수 있는 멀티모달 인공지능 모델이다.
기술
- Claude 4.6 Opus
- Gemini 3 Flash Preview
- Python
- OpenRouter API
- Google AI API
활용 사례
- LLM 에이전트의 GUI 조작 성능 평가
- VLM의 시각적 좌표 인식 정확도 테스트
- 모델별 도구 사용(Tool Use) 효율성 비교
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 25.수집 2026. 02. 25.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.