본문으로 건너뛰기

실제 환경에서의 AI 에이전트 자율성 측정 연구

Anthropic이 Claude Code와 API 데이터를 분석하여 AI 에이전트의 자율성 증가 추세와 사용자들의 변화하는 감독 전략을 공개했습니다.

섹션별 상세

01
Claude Code의 자율 작업 지속 시간이 25분 미만에서 45분 이상으로 약 2배 증가했다. 이는 모델 성능 향상뿐만 아니라 사용자가 도구에 대한 신뢰를 쌓고 더 복잡한 작업을 맡기기 시작했음을 시사한다.
Claude Code의 99.9 백분위수 턴 지속 시간 변화 그래프
Chart2025년 10월부터 2026년 1월까지 Claude Code가 한 번의 턴에서 자율적으로 작업하는 시간이 약 25분에서 45분으로 꾸준히 증가했음을 보여줍니다. 이는 모델의 성능 향상과 사용자의 신뢰 구축이 결합된 결과로 분석됩니다.
02
사용자의 숙련도가 높아질수록 '자동 승인(Auto-approve)' 비율이 20%에서 40% 이상으로 증가한다. 동시에 '중단(Interrupt)' 비율도 함께 상승하는데, 이는 숙련자가 모든 단계를 승인하는 대신 자율 실행을 허용하되 문제가 생길 때만 즉각 개입하는 효율적인 감독 전략으로 전환함을 의미한다.
사용자 경험(세션 수)에 따른 Claude Code 자동 승인율 변화
Chart사용자가 Claude Code를 더 많이 사용할수록 에이전트의 행동을 일일이 승인하지 않고 자동 승인 모드를 사용하는 비율이 20%에서 40% 이상으로 증가함을 나타냅니다. 이는 사용자가 에이전트의 역량을 파악함에 따라 더 많은 자율권을 부여함을 시사합니다.
사용자 경험에 따른 Claude Code 중단율 변화
Chart숙련된 사용자일수록 에이전트의 작업을 중단시키는 빈도가 높아지는 현상을 보여줍니다. 이는 자동 승인을 늘리는 동시에 실시간 모니터링을 통해 필요한 순간에만 개입하는 고도화된 감독 전략을 취하고 있음을 의미합니다.
03
에이전트가 스스로 판단하여 질문을 던지는 '클래리피케이션(Clarification)' 횟수가 인간의 중단 횟수보다 많다. 특히 복잡한 작업일수록 에이전트가 자신의 불확실성을 인지하고 인간에게 확인을 요청하는 빈도가 높아져, 시스템의 안전성을 보완하는 핵심 요소로 작용한다.
목표 복잡도에 따른 에이전트의 확인 요청 및 인간의 중단 비율 비교
Chart작업의 복잡도가 높아질수록 에이전트가 스스로 질문을 던지는 비율이 인간의 개입 비율보다 훨씬 가파르게 상승함을 보여줍니다. 고난도 작업에서 에이전트의 자기 불확실성 인지가 중요한 안전장치로 작동하고 있음을 증명합니다.
04
현재 에이전트 활동의 약 50%는 소프트웨어 엔지니어링에 집중되어 있으며, 의료, 금융, 사이버 보안 등 고위험 영역에서의 사용은 아직 초기 단계다. API 호출의 80% 이상이 최소 하나 이상의 안전장치를 갖추고 있으며, 비가역적인 행동(이메일 발송 등)은 0.8%에 불과해 현재까지는 비교적 안전하게 관리되고 있다.
도메인별 에이전트 도구 사용 분포
Chart현재 에이전트 활용 분야 중 소프트웨어 엔지니어링이 약 50%로 가장 큰 비중을 차지하고 있음을 보여줍니다. 그 외 비즈니스 인텔리전스, 고객 서비스 등 다양한 분야로 에이전트 도입이 확산되기 시작하는 초기 단계임을 시각화합니다.

기술

  • Claude Code
  • Claude API
  • Claude 3.5 Sonnet
  • Claude 3 Opus

활용 사례

  • 자율 코딩 에이전트
  • 에이전트 자율성 모니터링
  • 인간-AI 협업 시스템 설계
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 18.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.