본문으로 건너뛰기
The Verge AI조회 2

Anthropic 안전 책임자, AI 인류 멸종 확률 10% 이상 경고

Anthropic 안전 책임자가 10년 안에 AI가 모든 인간을 죽일 가능성을 10%보다 높게 평가하며 개발 경쟁의 안전 공백을 지적했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Anthropic의 AI 안전 책임자 Evan Hubinger가 향후 10년 안에 AI가 모든 인간을 죽일 가능성을 개인적으로 10%보다 높게 본다고 밝혔습니다. 이는 Anthropic과 OpenAI가 인간이 통제하기 어려운 자기개선형 초인간적 시스템을 먼저 개발하려는 경쟁에 들어갔다는 전직 연구자 Jacob Coxon의 비판에 대한 응답으로 나왔습니다. 위험의 핵심은 AI가 자신의 코드와 능력을 반복적으로 개선하는 재귀적 자기개선 과정이 통제 불능의 연쇄로 이어질 수 있다는 점입니다. Hubinger는 Anthropic이 고도화된 AI의 안전과 인간 가치 정렬을 보장할 계획을 아직 갖고 있지 않으며, 그런 계획을 마련하는 궤도에 올라섰다고 보기도 어렵다고 밝혔습니다.

섹션별 상세

01
Anthropic에서 AI 안전팀을 이끄는 Evan Hubinger는 동료 Jacob Coxon이 회사를 떠나며 제기한 비판에 응답했습니다. Coxon은 Anthropic과 OpenAI가 통제할 수 없는 초인간적 시스템을 먼저 만들기 위해 경쟁하며 인간의 생명을 걸고 있다고 비판했습니다. Hubinger는 자기개선형 AI의 위험이 자신들이 예상한 것보다 빠르게 현실화되고 있다는 취지로 동의했습니다.
02
논쟁의 중심에는 AI가 자신의 코드와 능력을 개선한 뒤 그 결과를 이용해 다시 개선하는 recursive self-improvement가 있습니다. 이 입력과 출력의 반복이 runaway loop로 이어지면 인간의 개입과 통제를 벗어난 시스템이 만들어질 수 있다는 우려입니다. 기사에 따르면 기업들은 아직 이 목표를 실현하지 못했지만, 현재 작성되는 AI 코드 상당 부분에 이미 AI가 관여하고 있습니다.
03
Hubinger는 향후 10년 안에 AI가 모든 인간을 죽일 가능성을 개인적으로 10%보다 높게 평가했습니다. 그는 Anthropic이 고도화된 AI를 안전하게 유지하고 인간 가치에 맞게 정렬할 계획을 아직 갖고 있지 않으며, 그런 계획을 명확히 마련하는 과정에 있다고 보기도 어렵다고 밝혔습니다. 구체적인 확률 추정과 안전 계획의 부재가 개발 속도와 통제 가능성 사이의 간극을 드러냅니다.
04
Coxon의 퇴사는 안전 우려 때문에 Anthropic을 떠난 사례 가운데 가장 주목받는 사례로 기사에 기록됐습니다. 그는 과거 OpenAI에서 AI 시스템을 훈련했고, 두 회사가 자기개선형 초지능을 향해 경쟁하면서 위험을 감수한다고 비판했습니다. Anthropic 역시 안전 문제를 우선시한다는 배경에서 설립됐지만, 내부 연구자의 이탈은 업계의 안전 약속과 실제 개발 관행 사이에 긴장이 남아 있음을 보여줍니다.
05
이번 논쟁은 AI 기업들이 예상되는 IPO를 준비하고 rogue agent 사건과 frontier model의 monitorability 문제에 대응하는 시점에 나왔습니다. 고도화된 모델의 행동을 감시하고 문제가 발생했을 때 원인을 파악하는 능력이 충분하지 않으면, 모델 성능 향상이 곧바로 안전성 확보로 이어지지 않습니다. 따라서 기사에서 제기된 핵심 문제는 AI 개발을 중단할지의 여부보다 통제 수단이 마련되기 전에 개발 경쟁이 앞서가고 있다는 점입니다.

용어 해설

재귀적 자기개선(Recursive Self-Improvement)
AI 시스템이 자신의 설계나 코드를 개선하고, 개선된 시스템이 다시 다음 개선을 수행하는 반복 구조를 뜻합니다. 기사에서는 이 과정이 인간의 통제를 벗어나는 runaway loop로 이어질 가능성이 안전 우려의 핵심으로 제기됩니다.
초인간적 시스템(Superhuman Systems)
인간의 능력을 여러 영역에서 넘어서는 AI 시스템을 가리키는 표현입니다. 기사에서는 Anthropic과 OpenAI가 이런 시스템을 통제할 준비가 충분하지 않은 상태에서 개발 경쟁을 이어간다는 우려와 연결됩니다.
AI 안전(AI Safety)
고도화된 AI가 인간의 의도와 가치에 맞게 작동하고 통제 가능한 상태를 유지하도록 위험을 줄이는 연구와 실천을 뜻합니다. 기사에서는 Anthropic 내부에서도 이를 보장할 구체적 계획이 아직 없다는 점이 핵심 쟁점입니다.

기술

  • Anthropic
  • OpenAI
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.