본문으로 건너뛰기

Anthropic, Claude 모델 성능 탈취를 위한 대규모 증류 공격 탐지 및 차단 발표

Anthropic이 DeepSeek, Moonshot, MiniMax 등 중국 AI 기업들이 1,600만 건 이상의 프롬프트를 통해 Claude의 추론 및 코딩 능력을 무단 복제하려 한 실태를 공개했다.

섹션별 상세

01
Anthropic은 DeepSeek, Moonshot, MiniMax가 산업적 규모로 Claude의 능력을 추출하려는 캠페인을 벌였음을 포착했다. 이들은 24,000여 개의 허위 계정을 통해 1,600만 건 이상의 데이터를 생성했으며, 이는 단순한 사용 패턴을 넘어선 조직적인 성능 탈취 행위로 분석됐다.
02
증류(Distillation)는 상위 모델의 출력을 하위 모델 학습에 사용하는 기법으로, 정당한 최적화 도구로 쓰이기도 하지만 경쟁사의 기술을 저비용으로 복제하는 데 악용될 수 있다. Anthropic은 이러한 무단 증류가 미국의 AI 기술 우위를 저해하고 수출 통제 조치를 무력화한다고 지적했다.
03
DeepSeek은 약 15만 건의 상호작용을 통해 Claude에게 내부 추론 과정을 단계별로 설명하게 하여 '생각의 사슬(CoT)' 데이터를 대량 생성했다. 또한 검열이 심한 주제에 대해 Claude의 안전한 답변 방식을 학습시켜 자신들의 모델이 정책에 민감한 질문을 처리하는 방식을 개선하려 시도했다.
04
Moonshot AI는 340만 건 이상의 상호작용을 통해 에이전트 추론, 도구 사용, 코딩 및 컴퓨터 사용 에이전트 개발 역량을 집중적으로 타겟팅했다. 이들은 수백 개의 허위 계정과 다양한 경로를 활용해 탐지를 피하려 했으며, Anthropic은 요청 메타데이터를 통해 이를 해당 연구소의 고위 인력과 연결 지었다.
05
MiniMax는 1,300만 건이 넘는 가장 큰 규모의 공격을 수행했으며, 특히 에이전트 코딩과 도구 오케스트레이션에 집중했다. Anthropic은 모델 출시 전 학습 단계에서 이들을 탐지했으며, Anthropic이 신규 모델을 출시하자 24시간 이내에 트래픽의 절반을 새 모델로 전환하는 기민함을 보였다.
06
공격자들은 중국 내 접근 제한을 피하기 위해 '하이드라 클러스터(Hydra Cluster)' 아키텍처를 사용하는 프록시 서비스를 이용했다. 이는 수만 개의 계정을 동시에 관리하며 증류 트래픽을 일반 사용자의 요청과 섞어 탐지를 어렵게 만드는 구조로, 계정 하나가 차단되면 즉시 새로운 계정으로 대체된다.
text
You are an expert data analyst combining statistical rigor with deep domain knowledge. Your goal is to deliver data-driven insights — not summaries or visualizations — grounded in real data and supported by complete and transparent reasoning.

증류 공격에 사용된 전형적인 프롬프트 예시로, 모델에게 상세하고 투명한 추론 과정을 요구하는 구조를 가짐

07
Anthropic은 분류기(Classifier)와 행동 지문(Behavioral Fingerprinting) 시스템을 구축하여 증류 공격 패턴을 실시간으로 식별하고 있다. 또한 클라우드 제공업체 및 타 연구소와 기술 지표를 공유하고, 계정 인증 절차를 강화하며 모델 수준의 보호 장치를 개발하는 등 다각적인 방어 전략을 실행 중이다.
증류 공격을 탐지하고 방어하는 과정을 시각화한 다이어그램
DiagramAPI 트래픽 내에서 비정상적인 패턴을 식별하고, 이를 통해 조직적인 증류 시도를 차단하는 Anthropic의 방어 메커니즘을 나타낸다. 공격자가 허위 계정을 통해 접근하더라도 행동 분석을 통해 필터링됨을 보여준다.

용어 해설

지식 증류(Distillation)
거대 모델(Teacher)의 출력을 학습 데이터로 사용하여 더 작고 효율적인 모델(Student)을 훈련시키는 기법이다. 본문에서는 타사 모델의 고도화된 추론 능력을 무단으로 복제하여 자사 모델의 성능을 높이려는 부정적인 행위로 규정됐다.
생각의 사슬(Chain-of-Thought)
모델이 복잡한 문제를 해결할 때 단계별 추론 과정을 생성하도록 유도하는 기법이다. 공격자들은 Claude에게 이 과정을 상세히 출력하게 함으로써 모델의 논리적 사고 방식을 데이터화하여 탈취하는 수단으로 악용했다.
하이드라 클러스터(Hydra Cluster)
수만 개의 허위 계정을 네트워크로 연결하여 트래픽을 분산시키는 프록시 아키텍처다. 특정 계정이 차단되더라도 다른 계정이 즉시 역할을 대체하여 대규모 데이터 추출을 지속하고 탐지를 회피하는 구조를 가진다.
수출 통제(Export Controls)
첨단 기술이나 전략 물자가 특정 국가로 유입되는 것을 제한하는 정부 정책이다. AI 분야에서는 고성능 GPU 칩의 접근을 제한하여 기술 격차를 유지하려 하며, 증류 공격은 이러한 통제의 실효성을 무력화하는 위협으로 간주된다.

기술

  • Claude 3.5
  • API
  • Chain-of-Thought
  • Hydra Cluster

활용 사례

  • 모델 성능 복제 방어
  • 허위 계정 탐지
  • 데이터 추출 방지
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 23.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.