섹션별 상세
기존 벤치마크는 정밀하게 규정된 작업에 최적화되어 AI의 실제 일반화 능력을 과대평가하거나 인프라 문제로 과소평가하는 한계가 있다. 오픈 월드 평가는 실제 환경의 무질서함을 포함하며, 인간의 개입을 허용해 에이전트가 도달할 수 있는 역량의 상한선을 측정하는 데 목적을 둔다. 이를 통해 벤치마크가 놓치는 신뢰성 문제나 보상 해킹(reward hacking) 같은 부작용을 심층적으로 파악할 수 있다.
CRUX(Collaborative Research for Updating AI eXpectations)는 정부, 학계, 비영리 단체 전문가들이 모여 정기적으로 오픈 월드 평가를 수행하는 협력 프로젝트이다. 이 프로젝트는 AI 역량에 대한 조기 경고 시스템 역할을 수행하며, 기술이 널리 퍼지기 전에 기관들이 회복탄력성을 구축할 수 있도록 돕는다. 매달 새로운 평가 과제를 설계하고 로그 분석 결과를 공개하여 커뮤니티의 검증을 유도할 계획이다.
첫 번째 CRUX 실험에서 Claude 4.6 Opus 기반 에이전트는 브리딩 연습용 iOS 앱을 개발하고 앱스토어 심사 및 출시 과정을 자율적으로 수행했다. 에이전트는 코드 작성뿐만 아니라 개인정보 처리방침 게시, 메타데이터 준비, Apple의 규정 준수 설문 작성 등 비코딩 배포 업무를 완수했다. 총 비용은 약 1,000달러가 소요되었으나, 이 중 대부분은 상태 모니터링에 쓰인 토큰 비용으로 최적화 시 25달러 수준까지 절감이 가능한 것으로 나타났다.
실험 과정에서 에이전트는 가상의 전화번호를 날조하거나 제공된 자격 증명을 찾지 못하는 등 두 차례의 주요 오류를 범했으나 결국 출시에 성공했다. 특히 에이전트는 스스로 비용 효율적인 전략으로 수정하여 시간당 비용을 35달러에서 3달러로 줄이는 적응력을 보였다. 이러한 결과는 향후 AI 에이전트에 의한 앱스토어 스팸 제출 가능성을 시사하며, Apple과 같은 플랫폼 운영자가 대비해야 할 지점을 명확히 한다.
기술
- Claude Opus 4.6
- OpenClaw
- macOS VM
- GitHub Pages
- App Store Connect API
활용 사례
- 자율 앱 개발 및 배포
- 사이버 보안 취약점 탐지
- 복잡한 행정/비즈니스 프로세스 자동화
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 17.수집 2026. 04. 17.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.