본문으로 건너뛰기

GPT-6 Astra의 로봇 조작 성능

GPT-6 Astra가 블록 집기에서는 앞섰지만 퍼즐 삽입에서는 Fable 5.1과 같은 성공률에 그쳤습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 비교는 같은 Inspect Robots agent policy와 20회씩의 로봇 조작 실험에서 GPT-6 Astra, Fable 5.1, Fable 5의 성능을 겨뤘습니다. 그릇에 빨간 블록을 넣는 작업에서 Astra는 19회 성공해 95%의 완료율을 기록했으며, Fable 5.1의 40%보다 높고 실행당 비용도 $0.94로 $2.12보다 낮았습니다. 반면 중앙 손잡이가 있는 파란 퍼즐 조각을 원형 홈에 넣는 작업에서는 Astra가 2회 성공해 Fable 5.1과 같은 10%에 머물렀고, 두 모델 모두 홈 앞 단계에서 자주 멈췄습니다. 비용 비교에는 토큰 단가와 자동 캐싱 처리 방식이 반영됐으며, 작업별 리그 차이와 운영자 주관 채점이 결과 해석의 제약으로 남았습니다.

섹션별 상세

01
실험은 같은 YAM 양팔 로봇과 Inspect Robots agent policy를 사용해 두 가지 조작 과제를 모델별 20회씩 수행하는 방식으로 구성됐습니다. 로봇은 팔마다 6자유도를 갖고, 세 개의 카메라 시점과 고유수용성 상태를 관측한 뒤 각 팔의 말단 장치 위치·자세와 그리퍼 명령을 출력했습니다. 동일한 25% 속도 제한과 중간 수준의 추론 설정을 적용했기 때문에, 작업별 성공률·실행 시간·토큰 비용을 함께 비교할 수 있었습니다.
02
그릇 작업에서 GPT-6 Astra는 빨간 블록을 집어 그릇 안에 넣는 과정을 20회 중 19회 완료해 95%의 성공률을 기록했습니다. Astra는 평균 2.1k 출력 토큰으로 실행당 예상 비용 $0.94, 평균 실행 시간 2.5분을 기록했으며, Fable 5.1은 8회 성공·12.9k 토큰·$2.12·6.8분을 기록했습니다. 물체에 접촉하고 들어 올린 뒤 목표 위에 배치하는 단계를 거쳐 최종 위치까지 도달한 비율이 Astra에서 크게 높아, 단순한 접근보다 전체 조작 연쇄의 안정성이 결과를 갈랐습니다.
03
퍼즐 작업에서는 중앙 손잡이를 잡아 파란 원형 조각을 대응하는 홈에 넣어야 했지만, Astra의 성공은 20회 중 2회에 그쳤습니다. Fable 5.1도 2회 성공해 두 모델의 완료율은 각각 10%였고, Astra의 실행당 비용은 $1.36으로 Fable 5.1의 $2.18보다 낮았지만 평균 소요 시간은 3.4분과 5.9분으로 집계됐습니다. Astra는 홈에 도달한 뒤 최종 삽입 단계에서 Fable 5.1과 같은 방식으로 멈추는 경향을 보였으므로, 물체 이동 능력만으로 정밀한 배치 문제를 해결하지 못했습니다.
04
채점자는 각 시도에서 모델이 도달한 가장 높은 단계를 0에서 4까지 기록했습니다. 1단계는 물체 접촉, 2단계는 테이블에서 들어 올리기, 3단계는 투입 지점 위에 배치하기, 4단계는 최종 위치에 놓기로 구성되어 실패한 실행도 어느 단계까지 진행됐는지 남겼습니다. 그릇 작업에서 Astra의 평균 단계 점수는 3.95로 Fable 5.1의 2.40과 Fable 5의 1.30보다 높았지만, 퍼즐 작업에서는 2.00으로 Fable 5.1의 2.35보다 낮아 마지막 정밀 조작이 병목으로 남았습니다.
05
비용은 세 모델에 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50의 목록 가격을 적용해 계산했으며, 청구 토큰이 아닌 wire-level 요청·응답 토큰을 사용했습니다. Astra 입력의 약 5분의 1은 OpenAI가 자동으로 캐시했지만 할인하지 않았고, Fable 요청에는 prompt caching을 적용하지 않았으므로 비용 비교는 Astra에 불리하게 잡혔을 가능성이 있습니다. 다만 Astra 실험은 Fable 실험 이틀 뒤 별도 수행됐고 그릇 작업의 리그도 달랐으며, 운영자가 모델을 알고 채점했기 때문에 95% 대 40%라는 차이를 모든 환경에 일반화하기에는 한계가 있습니다.

용어 해설

로봇 조작(Robotic Manipulation)
로봇 팔이 물체를 집고 이동시킨 뒤 지정된 위치에 놓는 작업입니다. 이 비교에서는 카메라 관측과 관절 상태를 바탕으로 양팔의 위치·자세·그리퍼 동작을 순차적으로 제어하며, 실제 작업 완료율과 중간 단계 도달 수준으로 모델 성능을 평가했습니다.
역기구학(Inverse Kinematics)
로봇 말단 장치의 목표 위치와 자세를 각 관절의 움직임으로 변환하는 계산 과정입니다. GPT-6 Astra와 Fable은 x, y, z 좌표와 yaw, pitch, roll, 그리퍼 명령을 출력하고, 로봇의 IK가 이를 관절 각도로 바꿔 실제 팔 동작을 생성합니다.
말단 장치 자세(End-Effector Pose)
로봇 팔 끝에 달린 그리퍼의 위치와 방향을 함께 나타내는 제어값입니다. 이 실험에서는 각 팔에 대해 세 방향의 좌표와 세 축의 회전값, 그리퍼 상태를 지정해 물체에 접근하고 들어 올린 뒤 놓는 동작을 구성했습니다.
단계별 채점(Stage Scoring)
작업의 성공 여부만 보지 않고 물체에 접근했는지, 접촉했는지, 들어 올렸는지, 목표 위에 배치했는지, 최종 위치에 놓았는지를 단계별로 기록하는 평가 방식입니다. 각 시도는 0에서 4까지의 최고 도달 단계로 채점되어 실패한 실행의 진행 수준도 비교에 포함됩니다.
프롬프트 캐싱(Prompt Caching)
반복되는 입력 일부를 저장해 다음 요청에서 다시 처리하는 비용을 줄이는 방식입니다. 이 비교에서는 OpenAI가 Astra 입력의 약 5분의 1을 자동으로 캐시했지만 할인은 비용 계산에 반영하지 않았으므로, Astra의 산정 비용이 실제보다 높게 잡혔을 가능성이 있습니다.

기술

  • GPT-6 Astra
  • Fable 5
  • Fable 5.1
  • YAM arms
  • Inspect Robots 0.58.0
  • Matplotlib v3.11.1

활용 사례

  • 양팔 로봇의 물체 집기와 배치
  • 정밀한 퍼즐 삽입 작업
  • LLM 기반 로봇 agent policy 평가
  • 로봇 추론 비용과 작업 성공률 비교

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 07.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.